Ollama 简介

Ollama 是什么?

Ollama 是开源的 本地大模型运行时:一条命令下载模型、在本机(或 Ollama Cloud)推理,并自动露出 HTTP API。项目由 Ollama 维护,仓库在 ollama/ollama

它解决的是「我想跑开源模型,但不想先搭 CUDA、vLLM、Tokenizer 和网关」:安装桌面端或 CLI 后,ollama run gemma4 就能聊天;后台服务监听 localhost:11434,应用用 REST 或 OpenAI 兼容客户端接入。


它在栈里的位置

┌─────────────────────────────────────────────────────────────┐
│                     你的应用 / Agent                         │
│   CLI · Python/JS · LangChain · Dify · Cursor · Hermes      │
└───────────────────────────┬─────────────────────────────────┘
                            │ HTTP
              ┌─────────────┴─────────────┐
              │  localhost:11434          │
              │  /api/*  或  /v1/*        │
              └─────────────┬─────────────┘

                    ┌───────┴───────┐
                    │    Ollama     │
                    │  调度 / KV 缓存 │
                    └───────┬───────┘
              ┌─────────────┴─────────────┐
              │ 本地权重(GGUF 等)        │
              │ 或 :cloud 卸载到云端       │
              └───────────────────────────┘
组件作用
CLI / 菜单ollama 打开交互菜单:跑模型、启动 Claude Code / OpenClaw / VS Code 等工具
本机服务默认 http://localhost:11434,安装后即可用
模型库ollama.com/library 提供聊天、代码、视觉、嵌入等标签
官方 SDKPython、JavaScript 库封装 chat / generate / embed

本地运行时 vs 云 API vs vLLM

维度Ollama云厂商 Chat APIvLLM / 自建推理
上手安装包 + ollama run账号、Key、计费镜像、GPU 驱动、启动参数
数据默认同机回环,请求不出网文本发到厂商自建则数据在你的集群
硬件消费级 GPU / Apple Silicon / CPU不占本机显存面向高吞吐服务端
接口原生 /api + OpenAI /v1各家 SDK多为 OpenAI 兼容
吞吐单机交互、开发、小团队弹性、多区域高并发、连续批处理
模型切换pull / 改标签即可受厂商目录限制要自己转权重、配模板

选型建议:

  • 个人开发、隐私草稿、离线演示、给 Agent 一个本机后端 → Ollama
  • 要 SLA、全球延迟、不维护 GPU → 云 API
  • 要对很多用户同时流式输出、吃满数据中心 GPU → vLLM(或同类推理引擎)

Ollama 也提供 Cloud 模型(如 gemma4:cloud):CLI 与 API 用法相同,权重大模型在云端跑,本机工具链不用改。这是「接口仍是 Ollama、算力可以不在本机」的折中,不是把整个产品变成封闭 SaaS。


隐私与边界

本地模型的默认路径: 提示词、上下文、生成结果在本机进程里完成,不必为「试一句 prompt」开通云账号。适合代码、病历草稿、未公开文档等敏感文本的本地实验

仍须自己负责的边界:

  • ollama run xxx:cloud 或直连 https://ollama.com/api 时,内容会发到 Ollama 云,需登录或 API Key,按对方条款处理数据。
  • 本机服务默认绑在 localhost;若把 OLLAMA_HOST 改成 0.0.0.0 或做了端口转发,局域网都能打到你的模型。
  • 模型许可证(Gemma、Llama、Qwen 等)与「权重存在磁盘上」是两件事:商用前读 Library 页面的许可。
  • 嵌入与 RAG 会把文档切片存进向量库,备份与访问控制要单独设计。

适合 / 需谨慎

适合: 本地问答与编程助手、OpenAI 兼容应用的替换基址、LangChain Agent 的本机模型、Dify 私有化模型供应商、在 Cursor 里填自定义 Base URL。

需谨慎: 要上百并发的生产网关(更适合 vLLM);只有 8GB 内存却硬跑 70B(应换小量化或 Cloud);把未加固的 11434 暴露到公网。


下一步

评论