Hub 模型库
Hugging Face Hub 是模型、数据集、Spaces 的协作平台。Transformers 的 from_pretrained / push_to_hub 默认就读这里。检查点数量已超过 100 万。
搜索模型
打开 huggingface.co/models,按任务、框架(PyTorch)、库(transformers)、语言筛选。卡片上的下载量、点赞、是否 gated 都要看。
本课推荐的搜索起点:
点进仓库后先读 Model card(模型卡),不要只复制 ID。
模型卡里看什么
模型卡是仓库根目录的 README.md,通常包括:
- 许可(Apache-2.0、MIT、自定义、不可商用)
- 训练数据与局限(偏见、语言覆盖)
- 用法(Pipeline 片段、
trust_remote_code是否需要) - 显存 / 硬件
- 门控:Llama 等需在网页点同意并
hf auth login
本教程示例避开门控墙。若你必须用 Llama,完成许可流程后再加载,不要在教程里假设读者已经点过同意。
数据集与 Spaces
- Datasets:与
load_dataset("rotten_tomatoes")同一套命名空间,页上有预览与引用。 - Spaces:用 Gradio / Streamlit / Docker 把 Demo 挂在 Hub 上,例如公开情感分类小工具。创建 Space 后把
pipeline包进app.py即可,本课只作预告——完整前端不是重点。
三者可以互相链接:模型卡里引用数据集,Space 里加载你的模型 ID。
登录与 push_to_hub
Trainer 也可在 TrainingArguments(push_to_hub=True, hub_model_id=repo) 后 trainer.push_to_hub()。仓库默认公开,私有仓需 Hub 账号权限。
推送前补全模型卡:任务、id2label、训练超参、评价分数、许可。空 README 的仓库很难被信任。
本地 ↔ Hub
CI 里用 HF_TOKEN 环境变量,不要把 Token 写进 Git。hf download org/name 可只拉文件不走 Python。
和 Ollama、Skills
把 Hub 上的开源权重量化后,可用本站 Ollama 做日常聊天。研究、对比 generate()、发 Spaces 则留在 Transformers。
用编码 Agent 批量改模型卡、上传数据集时,可启用 Hugging Face Skills;主路径仍是你自己会 from_pretrained 与读模型卡。