| 排名 | Ollama 命令 | 参数量 | 显存占用 (Q4_K_M) |
8GB 可跑? | 发布/更新 | 代码能力 | 特点与适用场景 |
|---|---|---|---|---|---|---|---|
| 🥇 1 | ollama run qwen3.5:4b | 4B | ~2.5 GB | ✅ 非常舒适 | 2026-03 | ⭐⭐⭐⭐⭐ |
2026年编程小模型之王。原生多模态(可分析代码截图)、思考模式、256K 上下文、Apache 2.0 商用许可。同显存下综合能力最强,可替代 Copilot 做日常补全和函数生成。最新 |
| 🥈 2 | ollama run qwen3:4b | 4B | ~2.5 GB | ✅ 非常舒适 | 2026-04 | ⭐⭐⭐⭐⭐ |
纯代码特化,无多模态。质量接近 Qwen2.5-72B-Instruct,HumanEval 得分极高。如果你不需要看图,这是 4B 规模里代码最纯粹的模型。 |
| 🥉 3 | ollama run qwen2.5-coder:7b | 7B | ~4.5 GB | ✅ 舒适 | 2025 持续更新 | ⭐⭐⭐⭐☆ |
老牌编程模型,Aider 基准接近 GPT-4o。支持 FIM(中间填充),32K 上下文。生态最成熟,文档和教程最多,适合不想折腾的用户。 |
| 4 | ollama run qwen2.5-coder:14b | 14B | ~8–9 GB | ⚠️ 边缘 | 2025 持续更新 | ⭐⭐⭐⭐⭐ |
代码能力比 7B 明显更强,适合长文件重构。但 8GB 卡需关闭浏览器/IDE 等其他程序,且上下文不能太长,否则 OOM。 |
| 5 | ollama run codegemma:7b | 7B | ~4.0 GB | ✅ 舒适 | 2024 | ⭐⭐⭐⭐☆ |
Google 出品,响应极快。适合嵌入编辑器做轻量级补全,但综合代码能力略逊于 Qwen 系列。 |
| 6 | ollama run starcoder2:7b | 7B | ~4.0 GB | ✅ 舒适 | 2024 | ⭐⭐⭐⭐☆ |
支持 600+ 编程语言,许可证极宽松(BigCode OpenRAIL-M)。适合商业/开源项目集成,多语言覆盖最广。 |
| 7 | ollama run phi4-mini | 3.8B | ~2.3 GB | ✅ 非常舒适 | 2025 | ⭐⭐⭐☆☆ |
微软出品,通用型小模型。代码能力不如专业编程模型,但胜在速度极快(RTX 4060 上 ~45 tok/s),适合简单代码解释和轻量补全。 |
| 8 | ollama run deepseek-coder:1.3b | 1.3B | ~1.0 GB | ✅ 极轻量 | 2023 | ⭐⭐⭐☆☆ |
超轻量,可常驻后台。适合 IDE 内联自动补全,不占用显存。但复杂逻辑和大型函数生成能力有限。 |
| — | ollama run qwen3-coder:30b | 30B (MoE) | ~19 GB | ❌ 不能 | 2026 | ⭐⭐⭐⭐⭐ |
本地编程模型天花板,SWE-bench 得分最高。但 19GB 权重远超 8GB 显存,即使 CPU offload 也会极慢。仅作参考。 |
| — | ollama run devstral:24b | 24B | ~16 GB | ❌ 不能 | 2026 | ⭐⭐⭐⭐⭐ |
Mistral 系 Agentic 编程模型,多文件工程能力极强。需要 ≥16GB VRAM,8GB 无法运行。仅作参考。 |
| 排名 | Ollama 命令 | 参数量 | 显存占用 (Q4_K_M) |
8GB 可跑? | 发布/更新 | 综合能力 | 特点与适用场景 |
|---|---|---|---|---|---|---|---|
| 🥇 1 | ollama run qwen3.5:9b | 9B (MoE) | ~6.8–7.2 GB | ⚠️ 极限可跑 | 2026-02 | ⭐⭐⭐⭐⭐ |
8GB 显存能跑的最强通用模型。原生多模态(文本+图像+视频)、201 语言、256K 上下文、MoE 架构。MMLU-Pro 82.5,LiveCodeBench 65.6。思考模式默认开启,质量极高但响应偏慢。最新强烈推荐 |
| 🥈 2 | ollama run qwen3:8b | 8B | ~4.6 GB | ✅ 舒适 | 2026 | ⭐⭐⭐⭐☆ |
Qwen3 系列主力,支持 /think 和 /no_think 切换。中文理解极佳,数学和推理强。比 3.5 老一代,但显存更宽松,速度更快。 |
| 🥉 3 | ollama run qwen2.5:7b | 7B | ~4.5 GB | ✅ 舒适 | 2025 持续更新 | ⭐⭐⭐⭐☆ |
中文场景老牌王者,128K 上下文,工具调用成熟。代码+通用兼顾,生态最完善。如果你主要用中文,这是稳妥之选。 |
| 4 | ollama run llama3.1:8b | 8B | ~4.9 GB | ✅ 舒适 | 2024-07 | ⭐⭐⭐⭐☆ |
Meta 官方基线模型,英文最强,工具调用生态最成熟。中文能力弱于 Qwen,但安全性和稳定性极高。适合英文为主的用户。 |
| 5 | ollama run gemma4:e4b | 4B (MoE) | ~3.0 GB | ✅ 非常舒适 | 2026-04 | ⭐⭐⭐⭐☆ |
Google 最新,原生多模态+音频输入+思考模式+工具调用。140+ 语言,256K 上下文。小 footprint 大能力,适合同时开多个模型。最新 |
| 6 | ollama run gemma4:12b | 12B (Dense) | ~7.4 GB (需 IQ4_XS) |
⚠️ 边缘 | 2026-04 | ⭐⭐⭐⭐⭐ |
Gemma 4 dense 版,综合能力比 e4b 更强,但需要更激进量化才能塞进 8GB。LiveCodeBench 表现优异,适合愿意折腾的用户。 |
| 7 | ollama run deepseek-r1:7b | 7B | ~4.5 GB | ✅ 舒适 | 2025-01 (R1) | ⭐⭐⭐⭐☆ |
推理特化模型,数学/逻辑/代码 Debug 极强。MATH 竞赛题得分 52%(同尺寸 Mistral 仅 28%)。但思考链很长,响应慢,不适合日常聊天。 |
| 8 | ollama run phi4-mini | 3.8B | ~2.3 GB | ✅ 非常舒适 | 2025 | ⭐⭐⭐☆☆ |
微软轻量模型,MMLU 接近 Llama 3.1 8B 但显存省 40%。128K 上下文,CPU 上也能跑 12 tok/s。适合长文档分析和轻量对话。 |
| 9 | ollama run llama3.2:3b | 3B | ~2.0 GB | ✅ 极轻量 | 2024 | ⭐⭐⭐☆☆ |
Ollama 下载量最高的模型,生态最成熟。适合边缘设备、快速工具路由、轻量聊天。综合能力一般,但速度和稳定性极佳。 |
| — | ollama run gpt-oss:20b | 20B (MoE) | ~14 GB | ❌ 不能 | 2026 | ⭐⭐⭐⭐⭐ |
OpenAI 开源 MoE,~o3-mini 水平。16GB 显存卡的甜点,8GB 无法运行。仅作参考。 |
| — | ollama run qwen3.6:27b | 27B (Dense) | ~17 GB | ❌ 不能 | 2026-04 | ⭐⭐⭐⭐⭐ |
消费级硬件最强 dense 模型,SWE-bench 77.2%。需要 24GB 显存,8GB 完全无法运行。仅作参考。 |
| 排名 | Ollama 命令 | 参数量 | 显存占用 (Q4_K_M) |
8GB 可跑? | 发布/更新 | 视觉能力 | 特点与适用场景 |
|---|---|---|---|---|---|---|---|
| 🥇 1 | ollama run qwen3-vl:8b | 8B | ~6–7 GB | ✅ 舒适 | 2026 | ⭐⭐⭐⭐⭐ |
Ollama 最强开源视觉模型。动态分辨率最高 4096×4096,中日韩英 OCR 最强,支持 8 图同时输入。可逐帧分析视频截图,生成剪辑描述、提取画面文字、识别 UI 元素。最新强烈推荐 |
| 🥈 2 | ollama run llama3.2-vision:11b | 11B | ~7–8 GB | ⚠️ 边缘 | 2024-09 | ⭐⭐⭐⭐⭐ |
Meta 官方视觉模型,文档和照片理解最佳。128K 上下文,工具调用成熟。但 11B 在 8GB 卡上需严格控制上下文长度,否则易 OOM。 |
| 🥉 3 | ollama run minicpm-v:8b | 8B | ~6 GB | ✅ 舒适 | 2025-2026 | ⭐⭐⭐⭐☆ |
文档 OCR 特化,发票、表格、密集文字识别准确率最高。训练数据包含高分辨率文档扫描。适合从视频截图中提取字幕、文字信息。 |
| 4 | ollama run internvl:8b | 8B | ~8 GB | ⚠️ 边缘 | 2025 | ⭐⭐⭐⭐☆ |
代码截图和 UI 分析最强。训练包含 GitHub 截图、UI 原型、代码执行输出。适合分析视频中的代码演示画面。 |
| 5 | ollama run llava:7b | 7B | ~5–6 GB | ✅ 舒适 | 2024 | ⭐⭐⭐☆☆ |
最老牌的开源 VLM,社区文档最丰富。通用图像问答、OCR、截图分析都能做,但分辨率支持较低(672×672),复杂场景理解弱于新一代。 |
| 6 | ollama run gemma3:4b | 4B | ~3 GB | ✅ 非常舒适 | 2025-03 | ⭐⭐⭐☆☆ |
Google 轻量视觉模型,128K 上下文。适合同时运行多个服务,或作为辅助视觉模型。已被 Gemma 4 系列取代,但 4B 规模仍有价值。 |
| 7 | ollama run moondream2 | 1.9B | ~1.5 GB | ✅ 极轻量 | 2024 | ⭐⭐☆☆☆ |
唯一能在 2GB 显存下运行的实用视觉模型。速度极快,但复杂场景、密集文字、精确图表理解能力有限。适合快速预览和简单描述。 |
| — | ollama run qwen3-vl:72b | 72B | ~48 GB | ❌ 不能 | 2026 | ⭐⭐⭐⭐⭐ |
开源视觉模型天花板,各项指标领先。需要 48GB 显存,8GB 完全无法运行。仅作参考。 |
| 排名 | Ollama 命令 | 参数量 | 显存占用 (Q4_K_M) |
8GB 可跑? | 发布/更新 | 推理能力 | 特点与适用场景 |
|---|---|---|---|---|---|---|---|
| 🥇 1 | ollama run deepseek-r1:7b | 7B | ~4.5 GB | ✅ 舒适 | 2025-01 (R1) | ⭐⭐⭐⭐⭐ |
本地推理之王。显式思维链,数学竞赛题 52% 得分(同尺寸 Mistral 仅 28%)。适合算法题、SQL 优化、复杂逻辑 Debug。思考过程可见,便于验证。强烈推荐 |
| 🥈 2 | ollama run qwen3.5:9b | 9B (MoE) | ~6.8–7.2 GB | ⚠️ 极限可跑 | 2026-02 | ⭐⭐⭐⭐⭐ |
思考模式默认开启,GPQA Diamond 81.7。多语言推理极强。但思考 token 消耗大,8GB 卡上长推理易触发 OOM,建议限制上下文。 |
| 🥉 3 | ollama run qwen3:8b | 8B | ~4.6 GB | ✅ 舒适 | 2026 | ⭐⭐⭐⭐☆ |
支持 /think 和 /no_think 切换,灵活控制推理深度。数学和多语言推理强,速度比 R1 快。适合需要快速响应+偶尔深度推理的场景。 |
| 4 | ollama run phi4-mini-reasoning | 3.8B | ~2.3 GB | ✅ 非常舒适 | 2025 | ⭐⭐⭐☆☆ |
微软专为低显存设计的推理模型。显存占用仅 2.3GB,可边开 IDE 边推理。但复杂任务能力弱于 7B+ 模型,适合日常 Debug 和轻量分析。 |
| 5 | ollama run gemma4:e4b | 4B (MoE) | ~3.0 GB | ✅ 非常舒适 | 2026-04 | ⭐⭐⭐⭐☆ |
思考模式可开关,STEM 推理不错。优势在于多模态(可分析图表、公式截图),适合需要"看图推理"的场景。 |
| 角色 | 推荐模型 | 命令 | 显存 | 理由 |
|---|---|---|---|---|
| 🧑💻 主力编程 | Qwen3.5 4B | ollama run qwen3.5:4b | ~2.5 GB | 2026 最新,多模态+思考+256K 上下文,同显存下代码能力最强 |
| 💬 通用助手 | Qwen3.5 9B | ollama run qwen3.5:9b | ~7.2 GB | 8GB 能跑的最强通用模型,中文+多模态+工具调用全能 |
| 🎬 视频辅助 | Qwen3-VL 8B | ollama run qwen3-vl:8b | ~6–7 GB | 最强开源视觉模型,分析视频帧、OCR、生成剪辑文案 |
| 🧮 逻辑推理 | DeepSeek-R1 7B | ollama run deepseek-r1:7b | ~4.5 GB | 思维链可见,数学/逻辑/Debug 准确率最高 |
| ⚡ 极速轻量 | Phi-4 Mini | ollama run phi4-mini | ~2.3 GB | 可常驻后台,长文档分析、快速问答不卡顿 |