对比 Ollama
一句话:Ollama 优化的是本机开发体验;vLLM 优化的是 GPU 上的生产吞吐。 二者都能露出 OpenAI 风格 /v1,所以应用层可以先对着 Ollama 写,再把 base_url 切到 vLLM。权重与模型卡仍在 Hugging Face。
对照表
什么时候用 Ollama
- 笔记本上改 prompt、演示、离线草稿
- 希望 10 分钟内
ollama run出回复 - 团队没有 NVIDIA 服务器,或只有 Apple Silicon
- Agent 开发阶段需要一个「够用的本机 OpenAI 兼容端」
走本站 Ollama 教程:安装 → run → /v1。不必先学 PagedAttention。
什么时候换成 vLLM
- 同时在线人数变多,Ollama 单机交互开始排队、GPU 利用率却上不去
- 已经有 A10 / A100 / L40S / H100,希望 tokens/s 成为 SLA
- 推理必须进公司 VPC,又要兼容现有 OpenAI SDK / LangChain
- 离线对 很多 prompt 做批量生成(数据合成、评测),需要连续批处理
切换成本通常是:同一套 chat.completions 代码,改 base_url 和 model 字符串,然后在 GPU 机器上 vllm serve。
Hugging Face 放在哪
可以记成:Hub 存权重 → Ollama 本地玩 → vLLM 对外服务。
不要混用的坑
- 把 Ollama 的模型名(如
gemma4)填进 vLLM 的--model:vLLM 要的是 Hub ID 或本地目录。 - 假设两边量化文件能互换:GGUF ≠ AWQ。
- 在同一张消费级显卡上同时开 Ollama 和 vLLM:抢显存,先
ollama stop/ 关掉另一个进程。 - 用 vLLM 的 Docker 镜像当「图形化模型商店」:没有 Ollama Library 那种 UX。
迁移检查清单
- 在 Ollama 用 OpenAI SDK 打通业务路径。
- 选 未门控 的 HF Instruct 仓(本课:
Qwen/Qwen2.5-0.5B-Instruct)在 vLLM 上serve。 - 只改
base_url=http://<gpu-host>:8000/v1与model=。 - 用生产级 prompt 对比质量;再开量化 / tp。
- 加上反向代理与限流,不要把
--api-key当唯一防护。