实战案例
三个可独立运行的小例子:终端问答、OpenAI 兼容客户端、定制编程助手。请先完成 安装 与 ollama pull gemma4(或你的替代模型)。
案例 1:本地问答 CLI
目标: 在终端里多轮提问,历史留在进程内,输入空行或 /bye 结束。
验证: 连续两轮提到同一专有名词,第二轮应能接上上下文。换模型只改 MODEL。要持久化历史,把 messages 写成 JSON;要查本地文档,先走 Embeddings,再接到 LangChain RAG。
案例 2:OpenAI 兼容的迷你 Python 客户端
目标: 不引入官方 ollama 包,只用 openai 包打 /v1,方便以后改回云厂商。
Windows 上若只想用系统自带能力、不写 Python,等价探测:
验证: 运行时 ollama ps 应出现 gemma4。把 base_url 改成错误端口应立即失败,说明没有误打到公网 OpenAI。
案例 3:自定义 Modelfile 编程助手
目标: 固定代码审查人设与偏低温度,供 Cursor / CLI 复用。
Modelfile:
用原生 API 冒烟:
在 Cursor 里把模型名填 kenhuang-coder,Base URL 仍为 http://localhost:11434/v1,见 应用集成。
想换中文底座:把 FROM 改成 Library 里的 qwen2.5(或当前等价标签)再 create 一个新名字,避免覆盖。