资源与延伸阅读

vLLM 的 CUDA 轮子、CLI 与量化枚举更新很快,官方文档 为准。本页汇总主文档、本站相关课,以及仓库位置。


官方

路径随改版搬家时,从文档首页搜索标题即可。


本课反复用到的事实

主题约定
安装pip install vllm;幸福路径 Linux + NVIDIA;Windows → WSL2
CLIvllm serve <model>;旧:python -m vllm.entrypoints.openai.api_server --model ...(弃用中)
HTTPhttp://localhost:8000/v1,对话 /v1/chat/completions
演示模型Qwen/Qwen2.5-0.5B-Instructfacebook/opt-125m(未门控)
多卡--tensor-parallel-size
量化标志--quantization / quantization=,预量化仓常可自动识别
镜像vllm/vllm-openai

本站相关课程

课程链接何时去看
Ollama/ollama/本机 DX、无服务器 GPU、先写应用
Hugging Face/huggingface/找仓、Tokenizer、模型卡、微调
LangChain/langchain/Agent / RAG,把 base_url 指到 vLLM
Docker/docker/镜像、卷、compose、GPU 运行时
PyTorch/pytorch/张量与 CUDA 心智模型

关系:Hub 上的检查点 → vLLM 服务 → 应用用 OpenAI 协议消费。


本教程索引

  1. vLLM 教程
  2. 简介
  3. 安装与环境
  4. 快速上手
  5. OpenAI 兼容 API
  6. 采样与生成参数
  7. 量化
  8. 生产服务
  9. 对比 Ollama
  10. Docker 部署
  11. 实战案例

推荐练习

  1. 用 Qwen 0.5B 打通 curl 与 OpenAI SDK 两条路径
  2. 同一 prompt 对比 temperature=00.9 的输出
  3. serve 加上 --max-model-len 并观察显存变化
  4. 阅读一个 AWQ 模型卡,尝试加载(显存不够就只读配置、不跑)
  5. vllm/vllm-openai 起容器,从另一终端访问 /v1/models

贡献

本教程位于 垦荒学园 / Kenhuang Academy。API 或镜像名变更时请提 Issue 或 PR,同步更新 docs/zh/vllm/docs/en/vllm/

评论