Hugging Face Transformers 完整教程
欢迎来到 Hugging Face 教程。首页卡片叫 Hugging Face,正文聚焦 Transformers 库与 Hub(模型 / 数据集 / Spaces)。内容依据 Transformers 官方文档 与 huggingface/transformers 整理,帮你从推理走到微调与分享。
Transformers 是文本、视觉、音频、视频与多模态的模型定义框架;Hub 上有 100 万+ 检查点。本教程示例一律用未门控(ungated) 小模型,避免 Llama 等许可证墙挡住第一次运行。
教程目录
基础篇
- Hugging Face 简介 — Hub、Transformers、生态,以及和本站 PyTorch / Ollama 的分工
- 安装与环境 — venv、PyTorch、
transformers、hf auth login,GPU 可选 - 快速上手 — 用
pipeline做分类或生成
核心 API
- Pipeline 推理 — 任务表,文本 / 视觉 / 音频示例
- Tokenizer 与模型 —
AutoTokenizer、AutoModelForCausalLM、编码解码 - 文本生成 —
generate()、贪婪 vs 采样、max_new_tokens
数据与训练
- Datasets 数据集 —
load_dataset、map、DataCollator - 微调训练 —
Trainer+rotten_tomatoes,或小因果 LM 的 LoRA - Hub 模型库 — 搜模型、模型卡、
push_to_hub、Spaces 预告
实战篇
学习路径
本教程选用的模型(均可公开下载)
和本站其他课程的关系
- 张量与训练循环:先看本站 PyTorch 教程,再回来用 Transformers 的
Trainer/generate()。 - 只想本地聊天:本站 Ollama 教程 更省事;本课面向研究、微调、自定义流水线。
- 编码 Agent:Hugging Face Skills(
SKILL.md)可让 Cursor / Claude Code 代操作 Hub,不是本课主路径。
前置知识
- Python 3.10+ 基础(函数、虚拟环境)
- 了解「预训练 → 微调 → 推理」即可;不必先会手写 Transformer
- 有 GPU 更好,但分类与 tiny 生成可在 CPU 上完成
学习建议
- 按目录顺序做,每一章都有可运行代码
- 第一次下载会走 Hub 缓存,请预留磁盘
- 遇到门控模型先换本课列出的 ungated 检查点
- 微调前先读模型卡上的许可与显存提示
- 编码 Agent 可用 Hugging Face Skills,但请先亲手跑通 Pipeline