模型库与量化
Ollama 的模型来自 ollama.com/library。每个页面给出完整名称、标签、体积、许可、能力(对话、代码、视觉、推理、嵌入)。本教程里的 gemma4 跟随官方快速上手;库会更新,以 Library 当前页为准。
名称与标签
完整引用是 name:tag。省略标签时通常等于 :latest。
常见标签类型:
- 体积 / 参数量:如
7b、8b、31b(数字随模型而变) - 量化:如
q4_K_M、q8_0(不是每个模型都暴露全部量化档) - 能力:
instruct、视觉、embed专用模型 - cloud:
xxx:cloud或名称里带-cloud
show 能看到家族、量化档、上下文上限等。不确定该拉哪一个时,打开 Library 复制页面上的 ollama run ... 整行。
量化:Q4 / Q8 怎么选
权重很少以满精度 FP16 分发。Ollama 使用的 GGUF 把每个参数压成更少的比特:
内存账(心算):
- 权重:70 亿参数 × 0.5 字节(约 Q4)≈ 3.5 GB;× 1 字节(约 Q8)≈ 7 GB。
- KV 缓存:随 上下文长度 和并发请求涨。官方按 VRAM 分档默认上下文(小于 24 GiB 常见约 4k;更大显存会给到 32k / 256k 量级)。Agent、网页检索、长仓库建议至少想到 64k,并确认显存够。
- 系统余量:桌面环境、浏览器、IDE 也占内存。Apple Silicon 上权重和系统抢同一块统一内存。
经验:先 ollama run 小 Q4,用 ollama ps 看是否 100% GPU。大量 CPU offload 时,换更小标签、缩短上下文,或改用 Cloud。
Cloud 模型
Cloud 模型不必在本机放下 70B/100B+ 权重,但仍用同一套 CLI / API。官方云文档示例包括 gemma4:cloud、gpt-oss:120b-cloud 等,列表以 Library 为准。
也可以不经过本机服务,直接打 https://ollama.com/api(带 API Key),见 REST 与 OpenAI 兼容 API。云模型会随时间下架,官方会给替代名;本机已 pull 的权重不受云下架影响。
需要完全离线时,关闭云功能(见官方 Cloud「Local only」说明),只 run 不带 :cloud 的标签。
复制、改名、清理
给旧工具一个「看起来像 OpenAI」的名字(官方兼容文档示例):
之后 /v1/chat/completions 的 model 可以写 gpt-3.5-turbo。更干净的做法是在客户端填真实 Ollama 名。
rm 只删本机副本。改存储根路径用 OLLAMA_MODELS(安装与环境)。
从哪里「进口」模型
多数情况 Library 足够。高级需求:
- Modelfile
FROM:已有本地名、GGUF 路径、部分 Safetensors 目录,见 Modelfile 定制 - Hugging Face 上的 GGUF:先在 Hugging Face 教程 搞清许可与量化,再
FROM ./model.gguf - 嵌入专用模型:不要用聊天模型当 embed,见 Embeddings