Hugging Face 课程怎么开始学?15 分钟搭好 Transformers 学习环境的两条路线
【免费下载链接】courseThe Hugging Face course on Transformers项目地址: https://gitcode.com/gh_mirrors/cou/course
晚上十点,你终于下定决心,这个周末要把 Transformers 啃下来。你打开 Hugging Face 课程的第一章,看到一行from transformers import pipeline,满怀期待地按下运行——结果屏幕弹出一行刺眼的红字:ModuleNotFoundError。
别急着怀疑自己。绝大多数人在第一天放弃,不是因为内容难,而是因为环境没就绪。工具没搭好,再精彩的课程也读不进去。而把环境搞定,其实只要 15 分钟——下面就是完整的操作路径。
出发之前,先看一眼这份 12 章地图
这门课程(The Hugging Face course on Transformers)完全免费开源,从第 0 章的 Setup 一路讲到第 12 章的训练推理模型。所有章节文件都组织在chapters/目录下,英文原版在chapters/en,简体中文译本在chapters/zh-CN。先看地图,你才知道每天学完该往哪儿走:
- 第 0~1 章|建立直觉:pipeline 是什么、编码器与解码器如何分工、Transformer 架构长什么样
- 第 2~3 章|上手实操:用 Transformers 库加载模型与分词器,并用 Trainer API 完成一次微调
- 第 4~6 章|生态三件套:Hub 模型库、Datasets 数据处理、Tokenizers 分词器
- 第 7 章|任务实战:命名实体识别、翻译、摘要、问答、从零训练因果语言模型
- 第 8~9 章|工程能力:报错排查、论坛求助技巧,以及用 Gradio 把模型变成可分享的 Demo
- 第 10~12 章|进阶方向:Argilla 数据标注、LLM 微调(SFT 与 LoRA)、GRPO 推理模型
课程里每章都配有随堂测验,第 1 章结束还有认证考试入口;如果你习惯看视频,subtitles/目录下还整理了配套视频字幕。这是一条有明确里程碑的路,而你的第一步,就是先把环境跑通。
上面这张图出自第 12 章:GRPO 的架构流程。它代表这条学习路径的终点——从"跑通一个 pipeline"一路升级到"亲手实现推理模型的训练"。千里之行,先从这个命令行开始。
先抄作业:5 分钟速查清单
不想看长篇分析?直接复制下面两条最小方案,任选其一就能开跑。
云端(推荐第一次接触的同学)——在笔记本的第一个单元格里执行:
!pip install transformers[sentencepiece]本地(电脑上已经有 Python 3.8+)——依次执行:
python -m venv .venv source .venv/bin/activate pip install "transformers[sentencepiece]"装完任意一条,跑一句冒烟测试:
import transformers print(transformers.__version__)能打印出版本号,环境就算及格了。至于为什么要带[sentencepiece]这个后缀——它会一并装好处理文本所需的分词器依赖,避免你学到第 6 章时才发现缺组件。两条路线具体怎么选,看下面三个问题。
三个问题,决定你走哪条路
不需要纠结,回答三个问题即可:
- 你的电脑有没有独立显卡?没有(或不确定),直接选云端,把训练交给远程 GPU;有,两条路都行。
- 接下来两小时能保持联网吗?能,选云端;可能断网或网速差,选本地更稳。
- 只是先试试水,还是打算长期学?试水选云端,零成本;长期建议本地,彻底掌控环境。
一句话总结:新手追求零配置 → 云端;进阶想要完全可控 → 本地。两条路并不互斥,很多人是云端入门、本地进阶。下面分别给出可照抄的步骤。
云端路线:三步在浏览器里开跑
第一步,新建笔记本。打开云端笔记本服务,新建一个 Python 笔记本,把它重命名成hf-course。
第二步,安装核心依赖。在第一个单元格输入上面的安装命令并运行。第一次安装需要一两分钟,属于正常节奏。
第三步,启用 GPU 并冒烟测试。在菜单里找到"修改 → 笔记本设置 → 硬件加速器",选择 GPU;然后运行import transformers验证安装。
⚠️ 一个必须知道的机制:云端每次断开重连后,运行时都会重置,已装的库会"消失"。这不是你的操作失误,而是设计如此——所以请把安装命令固定在笔记本的第一个单元格,让每次连接都自动重装。
本地路线:五步给项目建一个隔离舱
第一步,确认 Python 版本。运行python --version,确保是 3.8 及以上。
第二步,创建项目目录与虚拟环境:
mkdir nlp-projects cd nlp-projects python -m venv .venv第三步,激活虚拟环境:
source .venv/bin/activate激活后运行which python,看到路径指向.venv目录就说明成功。
第四步,安装依赖:
pip install "transformers[sentencepiece]"第五步,把依赖清单存档:
pip freeze > requirements.txt这份文件就是你的环境"身份证",以后换机器、换项目,一条pip install -r requirements.txt即可还原。
为什么一定要用虚拟环境?打个比方:全局 Python 环境像公共宿舍,你装一个库,可能挤掉室友的另一个库;虚拟环境则是独立单间,每个项目各住各的,互不打扰。之后升级库、装框架,都在激活后的虚拟环境里操作。
想离线精读课程原文?可以把仓库克隆到本地:
git clone https://gitcode.com/gh_mirrors/cou/course再按requirements.txt装好依赖,用utils/generate_notebooks.py一键把章节里的代码提取成 Jupyter notebook,边看边跑非常顺手。
环境就绪后,先跑通一个冒烟测试
环境搭好不等于万事大吉,还要验证整条链路。运行下面这段代码:
from transformers import pipeline classifier = pipeline("sentiment-analysis") classifier("I love this course!")如果输出结果是 positive(正面情感),恭喜——环境、模型下载、推理链路全部打通,你已经具备跟着第 1 章继续走的资格。注意:第一次运行会自动下载模型,需要几十秒到几分钟,属正常现象,别中途关掉。
四个高频翻车点与急救方案
- 报错
ModuleNotFoundError→ 大概率装错了环境。运行which python,确认解释器路径指向你激活的那个虚拟环境,然后重装。 - 装完 A 库,B 库坏了→ 版本冲突的典型症状。用虚拟环境加
requirements.txt锁定版本,升级前先pip freeze留个快照。 - 云端重连后库全部消失→ 云端是临时运行时,不是你的电脑。把安装命令放在笔记本开头,让它每次自动执行。
- 模型下载超时或卡住→ 先换一个小模型(如 distilbert 系列)验证流程,再换大模型;也可以提前把模型缓存到本地。
最后送你一条心法:报错信息里的最后一行才是真正的原因。学会读它,比背十篇教程都管用。
最后:环境只是门槛,课程才是正文
一句话总结:环境搭建是 15 分钟的事,不该占用你 15 天。现在就可以做三件事:
- 花 5 分钟,用上面的速查清单跑通
pipeline冒烟测试; - 打开课程第 1 章,跟着示例把"情感分析"这个 demo 玩出花样;
- 把这次踩过的坑记下来——第 8 章会教你如何把报错讲清楚、如何写出高质量的提问,那时你记录的素材就是最好的起点。
把环境准备好,剩下的交给好奇心。祝你在 Transformers 的世界里玩得开心。
【免费下载链接】courseThe Hugging Face course on Transformers项目地址: https://gitcode.com/gh_mirrors/cou/course
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考