实战案例
三个可独立运行的例子:离线批生成、OpenAI 兼容客户端、简易并发冒烟。请先 安装 并准备 NVIDIA GPU。演示模型保持 未门控:facebook/opt-125m 与 Qwen/Qwen2.5-0.5B-Instruct。
案例 1:离线批推理
目标: 对一批 prompt 生成短补全,体会连续批处理(引擎内部会把列表一起跑)。
验证: 三条都有非空输出;第二次运行应走缓存、启动更快。把列表加长到几十条,观察 GPU 利用率是否高于「一条条 Transformers generate」。
案例 2:指向 vLLM 的迷你聊天客户端
目标: 服务已用 vllm serve Qwen/Qwen2.5-0.5B-Instruct 拉起时,业务代码只依赖 openai 包。
PowerShell 冒烟(WSL 里的服务被 Windows 访问时,确认端口转发):
验证: 第二轮能引用第一轮里的专有名词。把 base_url 改成错误端口应立刻失败,说明没有误打到公网 OpenAI。接到 LangChain 时同样只改兼容 endpoint。
案例 3:并发请求冒烟
目标: 同时发出多路 chat,确认服务接受并发(连续批处理的意义)。不要对 0.5B 期望「生产 SLA」,只验证不会串响应。
验证: 八个结果都能回来;允许小模型偶发不严格只回数字。若全部超时,查 --max-num-seqs、显存、是否其实在 CPU 排队。
更认真的压测用官方 vllm bench(子命令以当前 CLI 为准)或独立负载工具,不要用这 0.5B 脚本当容量规划。