快速上手

本章从第一次对话走到常用进程命令。默认模型名跟随官方文档的 gemma4;若拉取失败或机器吃力,改成 Library 里的 qwen2.5、Llama 系列或其他小标签即可。


打开交互菜单

终端里只输入:

ollama

菜单可以:运行模型(进入对话),以及 启动工具(官方示例包括 Claude Code、OpenClaw、VS Code 等)。也可以用 ollama launchollama launch claude --model qwen3.5 指定集成,详见 CLI 参考应用集成


拉取并开始聊天

ollama run 若本地没有该模型,会先 pull 再进入 REPL:

ollama run gemma4

云端同名接口(需 ollama.com 账号,先 ollama signin):

ollama run gemma4:cloud

进来后输入一句话,例如:用一段话解释天空为什么是蓝色的。 多行输入可用 """ 包起来。视觉模型可把图片路径写进同一条消息:

ollama run gemma4 "这张图里有什么? /Users/you/Desktop/photo.png"

退出对话:/bye

>>> 提示符下输入:

/bye

这是官方快速上手给出的离开方式。会话结束,模型可能仍按 keep-alive 留在内存里,用下面的 ps / stop 管理。


只下载、不聊天

ollama pull gemma4

适合先在 CI 或弱网环境缓存权重,再在脚本里调用 API。删除:

ollama rm gemma4

查看已安装模型:ollama ls

ollama ls

会列出名称、ID、体积、修改时间。标签(如 :latest:cloud、量化后缀)见 模型库与量化


查看运行中模型:ollama ps

ollama ps

示例(字段以你本机为准):

NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minutes from now

关注 PROCESSOR(是否整卡加速)和 CONTEXT(上下文窗口)。Agent / 检索任务往往需要更大上下文,可用环境变量 OLLAMA_CONTEXT_LENGTH 或 Modelfile 的 num_ctx 调整,见 上下文长度


卸下内存中的模型:ollama stop

ollama stop gemma4

换大模型前先 stop,避免两份权重抢显存。也可用 API 把 keep_alive 设为 0 立即卸载,见 REST 与 OpenAI 兼容 API


后台服务

桌面安装通常已在跑服务。无托盘、无 systemd 时:

ollama serve

ollama serve --help 会列出可调环境变量(监听地址、模型目录、调试等)。Linux 生产环境优先用 systemd,而不是手工挂一个终端。


用 API 确认「真的在跑」

服务起来后,原生 generate(官方示例):

curl http://localhost:11434/api/generate -d '{"model": "gemma4", "prompt": "Why is the sky blue?"}'

Windows 更稳妥的是 curl.exe(避免被 PowerShell 别名干扰),或:

Invoke-RestMethod -Method Post -Uri "http://localhost:11434/api/generate" `
  -ContentType "application/json" `
  -Body '{"model":"gemma4","prompt":"Why is the sky blue?","stream":false}'

默认 stream 为 true 时,curl 会收到一行一行的 NDJSON。加 "stream": false 可拿一条完整 JSON。


第一天清单

  1. ollama --version 有输出
  2. ollama run gemma4(或更小的替代模型)能回复,并用 /bye 离开
  3. ollama ls 看得到模型;ollama ps 能解释 PROCESSOR
  4. 对本机 /api/generate 成功发出一次请求
  5. 选做:ollama run gemma4:cloud 对比本机与云端

下一步

评论