快速上手
本章从第一次对话走到常用进程命令。默认模型名跟随官方文档的 gemma4;若拉取失败或机器吃力,改成 Library 里的 qwen2.5、Llama 系列或其他小标签即可。
打开交互菜单
终端里只输入:
菜单可以:运行模型(进入对话),以及 启动工具(官方示例包括 Claude Code、OpenClaw、VS Code 等)。也可以用 ollama launch 或 ollama launch claude --model qwen3.5 指定集成,详见 CLI 参考 与 应用集成。
拉取并开始聊天
ollama run 若本地没有该模型,会先 pull 再进入 REPL:
云端同名接口(需 ollama.com 账号,先 ollama signin):
进来后输入一句话,例如:用一段话解释天空为什么是蓝色的。 多行输入可用 """ 包起来。视觉模型可把图片路径写进同一条消息:
退出对话:/bye
在 >>> 提示符下输入:
这是官方快速上手给出的离开方式。会话结束,模型可能仍按 keep-alive 留在内存里,用下面的 ps / stop 管理。
只下载、不聊天
适合先在 CI 或弱网环境缓存权重,再在脚本里调用 API。删除:
查看已安装模型:ollama ls
会列出名称、ID、体积、修改时间。标签(如 :latest、:cloud、量化后缀)见 模型库与量化。
查看运行中模型:ollama ps
示例(字段以你本机为准):
关注 PROCESSOR(是否整卡加速)和 CONTEXT(上下文窗口)。Agent / 检索任务往往需要更大上下文,可用环境变量 OLLAMA_CONTEXT_LENGTH 或 Modelfile 的 num_ctx 调整,见 上下文长度。
卸下内存中的模型:ollama stop
换大模型前先 stop,避免两份权重抢显存。也可用 API 把 keep_alive 设为 0 立即卸载,见 REST 与 OpenAI 兼容 API。
后台服务
桌面安装通常已在跑服务。无托盘、无 systemd 时:
ollama serve --help 会列出可调环境变量(监听地址、模型目录、调试等)。Linux 生产环境优先用 systemd,而不是手工挂一个终端。
用 API 确认「真的在跑」
服务起来后,原生 generate(官方示例):
Windows 更稳妥的是 curl.exe(避免被 PowerShell 别名干扰),或:
默认 stream 为 true 时,curl 会收到一行一行的 NDJSON。加 "stream": false 可拿一条完整 JSON。
第一天清单
ollama --version有输出ollama run gemma4(或更小的替代模型)能回复,并用/bye离开ollama ls看得到模型;ollama ps能解释 PROCESSOR- 对本机
/api/generate成功发出一次请求 - 选做:
ollama run gemma4:cloud对比本机与云端