资源与延伸阅读
vLLM 的 CUDA 轮子、CLI 与量化枚举更新很快,以 官方文档 为准。本页汇总主文档、本站相关课,以及仓库位置。
官方
路径随改版搬家时,从文档首页搜索标题即可。
本课反复用到的事实
本站相关课程
关系:Hub 上的检查点 → vLLM 服务 → 应用用 OpenAI 协议消费。
本教程索引
推荐练习
- 用 Qwen 0.5B 打通
curl与 OpenAI SDK 两条路径 - 同一 prompt 对比
temperature=0与0.9的输出 - 给
serve加上--max-model-len并观察显存变化 - 阅读一个 AWQ 模型卡,尝试加载(显存不够就只读配置、不跑)
- 用
vllm/vllm-openai起容器,从另一终端访问/v1/models
贡献
本教程位于 垦荒学园 / Kenhuang Academy。API 或镜像名变更时请提 Issue 或 PR,同步更新 docs/zh/vllm/ 与 docs/en/vllm/。