快速上手
本章用 未门控小模型 跑通两件事:离线生成,以及 OpenAI 兼容 HTTP。请先完成 安装,并确认 nvidia-smi 可见 GPU。
默认对话模型:
更小的补全模型(无聊天模板,适合 /v1/completions 或 LLM.generate):
两者都不必申请 Llama 许可证。显存仍紧张就换更小的 Instruct,或加 --max-model-len 2048。
启动 OpenAI 兼容服务
推荐(新 CLI):
首次会从 Hugging Face 拉权重,然后监听 8000 端口。日志里出现 Uvicorn / 就绪提示后再发请求。
旧模块入口(仍出现在大量博客里,源码侧已标弃用,以当前文档为准):
部分更新的提示可能写 vllm server 而不是 vllm serve。不确定就运行 vllm --help。
常用开关(完整列表以 --help 为准):
用 curl 打对话接口
基址:http://localhost:8000/v1。Instruct 模型走 Chat Completions:
Windows 的 WSL 外若用 PowerShell,请用 curl.exe,或:
model 字段通常填你启动时的模型 ID(或 /v1/models 返回的名字)。对上即可。
列出模型:
用 OpenAI Python SDK
本机默认往往不校验 Key;若启动时加了 --api-key token-abc123,这里就要填相同字符串。鉴权范围见 生产服务。
离线:LLM + SamplingParams
不必起 HTTP,适合批处理脚本:
对话模型可用 llm.chat(...)(API 以你安装的版本为准)。采样细节见 采样与生成参数。
第一天清单
nvidia-smi能看到 GPUpip install vllm后import vllm成功vllm serve Qwen/Qwen2.5-0.5B-Instruct保持运行curl或 SDK 拿到非空choices[0].message.content- 选做:用
facebook/opt-125m跑一段离线generate
失败时先看:显存是否不够(减小 --max-model-len)、Hub 是否下完、端口 8000 是否被占用。