快速上手
本章用 Pipeline 在本机跑通第一次推理。Pipeline 会自动下载 Tokenizer 与权重并缓存。示例全部 ungated。
情感分类(推荐第一段代码)
distilbert/distilbert-base-uncased-finetuned-sst-2-english 是 SST-2 上微调过的 DistilBERT,也是官方文档常用的分类示例:
典型输出:
发生了什么:
from_pretrained拉取config.json、词表、model.safetensors- 文本被 Tokenizer 变成
input_ids/attention_mask - 模型输出 logits,Pipeline 做 softmax 并映射标签
要自己微调同一架构,请用底座 distilbert/distilbert-base-uncased + rotten_tomatoes,见 微调训练。
文本生成(小模型)
CPU 友好的续写用 DistilGPT2;需要指令对话或中文时换 Qwen:
指令模型(体积约 0.5B,有 GPU 更顺畅):
国内读者还可在 Hub 搜索 Qwen、DeepSeek 的 Instruct 检查点,同样注意是否门控与显存。
显式设备
有 NVIDIA GPU 时,Pipeline 可指定 device=0。跨设备自动分流用底层 API:
只想聊天、不想管权重格式时,用本站 Ollama;要把生成参数摸清楚,继续读 文本生成。
第一次下载要等多久?
DistilBERT / DistilGPT2 大约几十到一百多 MB,Whisper-tiny 约 150MB,Qwen2.5-0.5B 约 1GB。进度条走完后,文件在 HF_HOME 缓存里,再跑同一脚本几乎是秒开。
第一个任务清单
- 建 venv,安装
torch与transformers datasets evaluate accelerate - 运行上面的分类 Pipeline
- 再跑 DistilGPT2 生成,观察
max_new_tokens - (可选)
hf auth login,为上传做准备 - 打开 Hub 扫一眼模型卡