Jiey Jiey 文档 打开 Jiey

Jiey 在 对话模式 下与本地模型配合良好。可完全离线运行模型——数据不会离开你的设备。

上下文长度

启动 Ollama 时设置上下文长度:


OLLAMA_CONTEXT_LENGTH=20000 ollama serve

增大上下文长度会占用更多 VRAM。运行 ollama ps 查看当前分配。更多细节见 Ollama 上下文长度文档

---

设置

在本地运行模型最简单的方式。

  1. 安装 Ollama

    ollama.com 下载并安装。

  2. 拉取模型

    
            ollama pull qwen/qwen3-4b
    
  3. 以更高上下文启动 Ollama

    
            OLLAMA_CONTEXT_LENGTH=20000 ollama serve
    
  4. 在 Jiey 中配置

    1. 打开 chrome://browseros/settings

    2. 在 Ollama 卡片上点击 使用

    3. 将 Model ID 设为 qwen/qwen3-4b

    4. 将 上下文窗口 设为 20000

    5. 点击 保存

    !Ollama in Jiey

不想用终端时,可用友好的图形界面。

  1. 安装 LM Studio

    lmstudio.ai 下载并安装。

  2. 加载模型

    打开 LM Studio → Developer 标签 → 加载模型。它会在 http://localhost:1234/v1/ 运行服务。

    !LM Studio

  3. 在 Jiey 中配置

    1. 打开 chrome://browseros/settings

    2. 在 OpenAI Compatible 卡片上点击 使用

    3. 将 Base URL 设为 http://localhost:1234/v1/

    4. 将 Model ID 设为你加载的模型

    5. 将 上下文窗口 至少设为 20000

    6. 点击 保存

    !LM Studio in Jiey

---

推荐模型

根据可用 RAM/VRAM 选择模型。较小的模型更快,但能力较弱。

轻量(5 GB 以下)

适合 8 GB RAM 的机器。响应快,适合简单聊天任务。

模型发布方参数量量化体积
qwen/qwen3-4bQwen4B4bit2.28 GB
mistralai/ministral-3-3bMistral3BQ4_K_M2.99 GB
deepseek-r1-distill-qwen-7blmstudio-community7BQ4_K_M4.68 GB
deepseek-r1-distill-llama-8blmstudio-community8BQ4_K_M4.92 GB

中档(10–15 GB)

需要 16+ GB RAM。推理更好,能较好处理较长对话。

模型发布方参数量量化体积
openai/gpt-oss-20bOpenAI20BMXFP412.11 GB
mistralai/magistral-smallMistral23.6B4bit13.28 GB
mistralai/devstral-small-2-2512Mistral24B4bit14.12 GB

重型(60+ GB)

适合 64+ GB RAM 的工作站。质量最接近云端模型。

模型发布方参数量量化体积
openai/gpt-oss-120bOpenAI120BMXFP463.39 GB