Hugging Face 课程怎么开始学?15 分钟搭好 Transformers 学习环境的两条路线
2026/8/19 19:29:40 网站建设 项目流程

Hugging Face 课程怎么开始学?15 分钟搭好 Transformers 学习环境的两条路线

【免费下载链接】courseThe Hugging Face course on Transformers项目地址: https://gitcode.com/gh_mirrors/cou/course

晚上十点,你终于下定决心,这个周末要把 Transformers 啃下来。你打开 Hugging Face 课程的第一章,看到一行from transformers import pipeline,满怀期待地按下运行——结果屏幕弹出一行刺眼的红字:ModuleNotFoundError

别急着怀疑自己。绝大多数人在第一天放弃,不是因为内容难,而是因为环境没就绪。工具没搭好,再精彩的课程也读不进去。而把环境搞定,其实只要 15 分钟——下面就是完整的操作路径。

出发之前,先看一眼这份 12 章地图

这门课程(The Hugging Face course on Transformers)完全免费开源,从第 0 章的 Setup 一路讲到第 12 章的训练推理模型。所有章节文件都组织在chapters/目录下,英文原版在chapters/en,简体中文译本在chapters/zh-CN。先看地图,你才知道每天学完该往哪儿走:

  • 第 0~1 章|建立直觉:pipeline 是什么、编码器与解码器如何分工、Transformer 架构长什么样
  • 第 2~3 章|上手实操:用 Transformers 库加载模型与分词器,并用 Trainer API 完成一次微调
  • 第 4~6 章|生态三件套:Hub 模型库、Datasets 数据处理、Tokenizers 分词器
  • 第 7 章|任务实战:命名实体识别、翻译、摘要、问答、从零训练因果语言模型
  • 第 8~9 章|工程能力:报错排查、论坛求助技巧,以及用 Gradio 把模型变成可分享的 Demo
  • 第 10~12 章|进阶方向:Argilla 数据标注、LLM 微调(SFT 与 LoRA)、GRPO 推理模型

课程里每章都配有随堂测验,第 1 章结束还有认证考试入口;如果你习惯看视频,subtitles/目录下还整理了配套视频字幕。这是一条有明确里程碑的路,而你的第一步,就是先把环境跑通。

上面这张图出自第 12 章:GRPO 的架构流程。它代表这条学习路径的终点——从"跑通一个 pipeline"一路升级到"亲手实现推理模型的训练"。千里之行,先从这个命令行开始。

先抄作业:5 分钟速查清单

不想看长篇分析?直接复制下面两条最小方案,任选其一就能开跑。

云端(推荐第一次接触的同学)——在笔记本的第一个单元格里执行:

!pip install transformers[sentencepiece]

本地(电脑上已经有 Python 3.8+)——依次执行:

python -m venv .venv source .venv/bin/activate pip install "transformers[sentencepiece]"

装完任意一条,跑一句冒烟测试:

import transformers print(transformers.__version__)

能打印出版本号,环境就算及格了。至于为什么要带[sentencepiece]这个后缀——它会一并装好处理文本所需的分词器依赖,避免你学到第 6 章时才发现缺组件。两条路线具体怎么选,看下面三个问题。

三个问题,决定你走哪条路

不需要纠结,回答三个问题即可:

  1. 你的电脑有没有独立显卡?没有(或不确定),直接选云端,把训练交给远程 GPU;有,两条路都行。
  2. 接下来两小时能保持联网吗?能,选云端;可能断网或网速差,选本地更稳。
  3. 只是先试试水,还是打算长期学?试水选云端,零成本;长期建议本地,彻底掌控环境。

一句话总结:新手追求零配置 → 云端;进阶想要完全可控 → 本地。两条路并不互斥,很多人是云端入门、本地进阶。下面分别给出可照抄的步骤。

云端路线:三步在浏览器里开跑

第一步,新建笔记本。打开云端笔记本服务,新建一个 Python 笔记本,把它重命名成hf-course

第二步,安装核心依赖。在第一个单元格输入上面的安装命令并运行。第一次安装需要一两分钟,属于正常节奏。

第三步,启用 GPU 并冒烟测试。在菜单里找到"修改 → 笔记本设置 → 硬件加速器",选择 GPU;然后运行import transformers验证安装。

⚠️ 一个必须知道的机制:云端每次断开重连后,运行时都会重置,已装的库会"消失"。这不是你的操作失误,而是设计如此——所以请把安装命令固定在笔记本的第一个单元格,让每次连接都自动重装。

本地路线:五步给项目建一个隔离舱

第一步,确认 Python 版本。运行python --version,确保是 3.8 及以上。

第二步,创建项目目录与虚拟环境:

mkdir nlp-projects cd nlp-projects python -m venv .venv

第三步,激活虚拟环境:

source .venv/bin/activate

激活后运行which python,看到路径指向.venv目录就说明成功。

第四步,安装依赖:

pip install "transformers[sentencepiece]"

第五步,把依赖清单存档:

pip freeze > requirements.txt

这份文件就是你的环境"身份证",以后换机器、换项目,一条pip install -r requirements.txt即可还原。

为什么一定要用虚拟环境?打个比方:全局 Python 环境像公共宿舍,你装一个库,可能挤掉室友的另一个库;虚拟环境则是独立单间,每个项目各住各的,互不打扰。之后升级库、装框架,都在激活后的虚拟环境里操作。

想离线精读课程原文?可以把仓库克隆到本地:

git clone https://gitcode.com/gh_mirrors/cou/course

再按requirements.txt装好依赖,用utils/generate_notebooks.py一键把章节里的代码提取成 Jupyter notebook,边看边跑非常顺手。

环境就绪后,先跑通一个冒烟测试

环境搭好不等于万事大吉,还要验证整条链路。运行下面这段代码:

from transformers import pipeline classifier = pipeline("sentiment-analysis") classifier("I love this course!")

如果输出结果是 positive(正面情感),恭喜——环境、模型下载、推理链路全部打通,你已经具备跟着第 1 章继续走的资格。注意:第一次运行会自动下载模型,需要几十秒到几分钟,属正常现象,别中途关掉。

四个高频翻车点与急救方案

  • 报错ModuleNotFoundError→ 大概率装错了环境。运行which python,确认解释器路径指向你激活的那个虚拟环境,然后重装。
  • 装完 A 库,B 库坏了→ 版本冲突的典型症状。用虚拟环境加requirements.txt锁定版本,升级前先pip freeze留个快照。
  • 云端重连后库全部消失→ 云端是临时运行时,不是你的电脑。把安装命令放在笔记本开头,让它每次自动执行。
  • 模型下载超时或卡住→ 先换一个小模型(如 distilbert 系列)验证流程,再换大模型;也可以提前把模型缓存到本地。

最后送你一条心法:报错信息里的最后一行才是真正的原因。学会读它,比背十篇教程都管用。

最后:环境只是门槛,课程才是正文

一句话总结:环境搭建是 15 分钟的事,不该占用你 15 天。现在就可以做三件事:

  1. 花 5 分钟,用上面的速查清单跑通pipeline冒烟测试;
  2. 打开课程第 1 章,跟着示例把"情感分析"这个 demo 玩出花样;
  3. 把这次踩过的坑记下来——第 8 章会教你如何把报错讲清楚、如何写出高质量的提问,那时你记录的素材就是最好的起点。

把环境准备好,剩下的交给好奇心。祝你在 Transformers 的世界里玩得开心。

【免费下载链接】courseThe Hugging Face course on Transformers项目地址: https://gitcode.com/gh_mirrors/cou/course

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询