模型库与量化

Ollama 的模型来自 ollama.com/library。每个页面给出完整名称、标签、体积、许可、能力(对话、代码、视觉、推理、嵌入)。本教程里的 gemma4 跟随官方快速上手;库会更新,以 Library 当前页为准


名称与标签

完整引用是 name:tag。省略标签时通常等于 :latest

写法含义
gemma4官方文档默认聊天示例;等同该模型的默认标签
gemma4:cloud同一家族的 Cloud 变体,算力在 Ollama 云
qwen2.5中文与代码常选的替代系列(具体大小看标签)
llama3.2 / 其他 Llama生态示例里常见的通用替代

常见标签类型:

  • 体积 / 参数量:如 7b8b31b(数字随模型而变)
  • 量化:如 q4_K_Mq8_0(不是每个模型都暴露全部量化档)
  • 能力instruct、视觉、embed 专用模型
  • cloudxxx:cloud 或名称里带 -cloud
ollama pull gemma4
ollama pull qwen2.5
ollama show gemma4
ollama show --modelfile gemma4

show 能看到家族、量化档、上下文上限等。不确定该拉哪一个时,打开 Library 复制页面上的 ollama run ... 整行。


量化:Q4 / Q8 怎么选

权重很少以满精度 FP16 分发。Ollama 使用的 GGUF 把每个参数压成更少的比特:

档位(简化)直觉何时选
Q4(如 Q4_K_M)体积大约减半再减一点,质量通常够日常对话笔记本 8–16 GB 显存 / 统一内存
Q8更接近原精度,体积接近「参数量 × 1 字节」显存富余、要少一点量化噪声
更低(Q2/Q3 等)很省,幻觉和乱码风险升高只做冒烟测试

内存账(心算):

  1. 权重:70 亿参数 × 0.5 字节(约 Q4)≈ 3.5 GB;× 1 字节(约 Q8)≈ 7 GB。
  2. KV 缓存:随 上下文长度 和并发请求涨。官方按 VRAM 分档默认上下文(小于 24 GiB 常见约 4k;更大显存会给到 32k / 256k 量级)。Agent、网页检索、长仓库建议至少想到 64k,并确认显存够。
  3. 系统余量:桌面环境、浏览器、IDE 也占内存。Apple Silicon 上权重和系统抢同一块统一内存。

经验:先 ollama run 小 Q4,用 ollama ps 看是否 100% GPU。大量 CPU offload 时,换更小标签、缩短上下文,或改用 Cloud。


Cloud 模型

Cloud 模型不必在本机放下 70B/100B+ 权重,但仍用同一套 CLI / API。官方云文档示例包括 gemma4:cloudgpt-oss:120b-cloud 等,列表以 Library 为准。

ollama signin
ollama run gemma4:cloud
# 或
ollama pull gpt-oss:120b-cloud

也可以不经过本机服务,直接打 https://ollama.com/api(带 API Key),见 REST 与 OpenAI 兼容 API。云模型会随时间下架,官方会给替代名;本机已 pull 的权重不受云下架影响

需要完全离线时,关闭云功能(见官方 Cloud「Local only」说明),只 run 不带 :cloud 的标签。


复制、改名、清理

给旧工具一个「看起来像 OpenAI」的名字(官方兼容文档示例):

ollama pull llama3.2
ollama cp llama3.2 gpt-3.5-turbo

之后 /v1/chat/completionsmodel 可以写 gpt-3.5-turbo。更干净的做法是在客户端填真实 Ollama 名。

ollama ls
ollama rm 不再用的标签

rm 只删本机副本。改存储根路径用 OLLAMA_MODELS安装与环境)。


从哪里「进口」模型

多数情况 Library 足够。高级需求:

  • Modelfile FROM:已有本地名、GGUF 路径、部分 Safetensors 目录,见 Modelfile 定制
  • Hugging Face 上的 GGUF:先在 Hugging Face 教程 搞清许可与量化,再 FROM ./model.gguf
  • 嵌入专用模型:不要用聊天模型当 embed,见 Embeddings

选型清单

场景起点(仍以 Library 为准)
官方文档对齐、通用对话gemma4
中文写作 / 本地知识库qwen2.5 等中文强的标签
本机写代码、小补全中小 instruct / coder 标签
本机显存不够、要大推理*:cloud
RAG 向量embeddinggemma 或 Library 里的 embed 模型

下一步

评论