Ollama 简介
Ollama 是什么?
Ollama 是开源的 本地大模型运行时:一条命令下载模型、在本机(或 Ollama Cloud)推理,并自动露出 HTTP API。项目由 Ollama 维护,仓库在 ollama/ollama。
它解决的是「我想跑开源模型,但不想先搭 CUDA、vLLM、Tokenizer 和网关」:安装桌面端或 CLI 后,ollama run gemma4 就能聊天;后台服务监听 localhost:11434,应用用 REST 或 OpenAI 兼容客户端接入。
它在栈里的位置
本地运行时 vs 云 API vs vLLM
选型建议:
- 个人开发、隐私草稿、离线演示、给 Agent 一个本机后端 → Ollama
- 要 SLA、全球延迟、不维护 GPU → 云 API
- 要对很多用户同时流式输出、吃满数据中心 GPU → vLLM(或同类推理引擎)
Ollama 也提供 Cloud 模型(如 gemma4:cloud):CLI 与 API 用法相同,权重大模型在云端跑,本机工具链不用改。这是「接口仍是 Ollama、算力可以不在本机」的折中,不是把整个产品变成封闭 SaaS。
隐私与边界
本地模型的默认路径: 提示词、上下文、生成结果在本机进程里完成,不必为「试一句 prompt」开通云账号。适合代码、病历草稿、未公开文档等敏感文本的本地实验。
仍须自己负责的边界:
ollama run xxx:cloud或直连https://ollama.com/api时,内容会发到 Ollama 云,需登录或 API Key,按对方条款处理数据。- 本机服务默认绑在 localhost;若把
OLLAMA_HOST改成0.0.0.0或做了端口转发,局域网都能打到你的模型。 - 模型许可证(Gemma、Llama、Qwen 等)与「权重存在磁盘上」是两件事:商用前读 Library 页面的许可。
- 嵌入与 RAG 会把文档切片存进向量库,备份与访问控制要单独设计。
适合 / 需谨慎
适合: 本地问答与编程助手、OpenAI 兼容应用的替换基址、LangChain Agent 的本机模型、Dify 私有化模型供应商、在 Cursor 里填自定义 Base URL。
需谨慎: 要上百并发的生产网关(更适合 vLLM);只有 8GB 内存却硬跑 70B(应换小量化或 Cloud);把未加固的 11434 暴露到公网。