Jiey 在 对话模式 下与本地模型配合良好。可完全离线运行模型——数据不会离开你的设备。
上下文长度
启动 Ollama 时设置上下文长度:
OLLAMA_CONTEXT_LENGTH=20000 ollama serve
增大上下文长度会占用更多 VRAM。运行 ollama ps 查看当前分配。更多细节见 Ollama 上下文长度文档。
---
设置
在本地运行模型最简单的方式。
安装 Ollama
从 ollama.com 下载并安装。
拉取模型
ollama pull qwen/qwen3-4b以更高上下文启动 Ollama
OLLAMA_CONTEXT_LENGTH=20000 ollama serve在 Jiey 中配置
1. 打开
chrome://browseros/settings2. 在 Ollama 卡片上点击 使用
3. 将 Model ID 设为
qwen/qwen3-4b4. 将 上下文窗口 设为
200005. 点击 保存
不想用终端时,可用友好的图形界面。
安装 LM Studio
从 lmstudio.ai 下载并安装。
加载模型
打开 LM Studio → Developer 标签 → 加载模型。它会在
http://localhost:1234/v1/运行服务。在 Jiey 中配置
1. 打开
chrome://browseros/settings2. 在 OpenAI Compatible 卡片上点击 使用
3. 将 Base URL 设为
http://localhost:1234/v1/4. 将 Model ID 设为你加载的模型
5. 将 上下文窗口 至少设为
200006. 点击 保存
---
推荐模型
根据可用 RAM/VRAM 选择模型。较小的模型更快,但能力较弱。
轻量(5 GB 以下)
适合 8 GB RAM 的机器。响应快,适合简单聊天任务。
| 模型 | 发布方 | 参数量 | 量化 | 体积 |
|---|---|---|---|---|
qwen/qwen3-4b | Qwen | 4B | 4bit | 2.28 GB |
mistralai/ministral-3-3b | Mistral | 3B | Q4_K_M | 2.99 GB |
deepseek-r1-distill-qwen-7b | lmstudio-community | 7B | Q4_K_M | 4.68 GB |
deepseek-r1-distill-llama-8b | lmstudio-community | 8B | Q4_K_M | 4.92 GB |
中档(10–15 GB)
需要 16+ GB RAM。推理更好,能较好处理较长对话。
| 模型 | 发布方 | 参数量 | 量化 | 体积 |
|---|---|---|---|---|
openai/gpt-oss-20b | OpenAI | 20B | MXFP4 | 12.11 GB |
mistralai/magistral-small | Mistral | 23.6B | 4bit | 13.28 GB |
mistralai/devstral-small-2-2512 | Mistral | 24B | 4bit | 14.12 GB |
重型(60+ GB)
适合 64+ GB RAM 的工作站。质量最接近云端模型。
| 模型 | 发布方 | 参数量 | 量化 | 体积 |
|---|---|---|---|---|
openai/gpt-oss-120b | OpenAI | 120B | MXFP4 | 63.39 GB |