微调训练
官方训练入口是 Trainer。本章先用 DistilBERT + rotten_tomatoes 做完整分类微调(CPU 也能跑完一小截);再给 PEFT LoRA 草图。全参硬训 7B 不是入门作业。
显存警告: DistilBERT 分类在 4GB 级 GPU 或 CPU 上可行(CPU 会慢)。对因果 LM 做全参微调很容易 OOM——请用 LoRA,或先在本站 PyTorch 里搞清 batch 与梯度。没有 GPU 时,把 max_steps 设很小做「能跑通」即可。
Trainer:影评情感分类
CPU 试跑可改 per_device_train_batch_size=4,并用 raw["train"].select(range(512))。学完循环细节仍建议对照本站 PyTorch 教程。
推理刚训好的模型
标签可能是 LABEL_0 / LABEL_1。可在 from_pretrained(..., num_labels=2) 时传入 id2label={0: "NEGATIVE", 1: "POSITIVE"}。
PEFT LoRA 最小草图
只训练低秩适配器,底座冻结。适合 Qwen/Qwen2.5-0.5B-Instruct 这类小因果 LM(仍建议有 GPU):
pip install peft。训完 model.save_pretrained("./qwen-lora") 只保存适配器(数 MB 到几十 MB),再 PeftModel.from_pretrained(base, "./qwen-lora")。完整数据整理见 实战案例。
何时不要上 Trainer
Agent 代写训练脚本可用 Hugging Face Skills 里的 trainer skill,仍需你看懂显存与许可。