很多人卡在人工智能这条路上,不是因为数学不够好,也不是因为代码写不出来,而是被术语绊住了。读一篇论文,摘要里五个词组有四个要查;看官方文档,"指令微调""对齐""上下文学习"混在一起,不知道哪个是训练阶段哪个是推理技巧;面试被问一句"你了解自监督预训练吗",脑子里先蹦出来的是"self-supervised"这个英文单词,而不是它到底在做什么。这就是我动手整理这份**人工智能专业术语表(中英文对照)**的直接原因。这份表覆盖基础概念、网络结构、大模型、评估指标、工程落地、职业认证六个层面,每个术语都给中文名、英文名,外加一句"人话解释"。它适合三类人:刚入门想建立框架的学生,做项目需要快速对齐词汇的工程师,以及要写大作业、准备面试、考认证的人。我尽量不写成字典,而是写成一份可以直接拿来用的工具。
1. 为什么术语表比教程更该先看
1.1 术语混乱带来的真实麻烦
我先说一个很具体的场景。有次带一个刚转方向的同学做文本分类项目,他跑通了代码,准确率也有 0.9,但复盘的时候说不清楚自己做了什么。问他"你用的是交叉验证还是固定划分",他答"我就是随机分的"。问他"F1 是多少",他答"我只看准确率"。这不是能力问题,是词汇没对齐导致的表达失能——他知道自己在做什么,但没有对应的术语去指称它,所以在沟通和写作时全部塌陷成"我就是那样做的"。
术语混乱还有更隐蔽的代价。人工智能领域有个特点:同一个概念在不同圈层有不同叫法。学术界叫Representation Learning(表示学习),工程界常说Feature Extraction(特征提取),到了产品文档里又变成"语义理解"。你要是不建立一张对照表,就会以为是三个东西,结果重复学了三遍。反过来,有些词看着像同义词,实际差得很远,比如Parameter(参数)和Hyperparameter(超参数),一个由训练自动学出来,一个必须你自己设定,混用会让你的实验记录完全失去可复现性。
我自己的做法是,每进入一个新子领域,先花两个小时只做一件事:把该领域高频出现的三十到五十个术语抄下来,写下中英文和一句话解释,然后再去读教程。这个顺序反过来做,效率会低很多,因为教程默认你已经懂了那些词。
1.2 这份表的组织逻辑与使用方式
这份表的组织逻辑是按"从地基到楼顶"排的,不是按字母排。字母序适合查阅,不适合建立认知。我把它分成六层:基础概念层回答"这是什么学科、怎么学";网络结构层回答"模型内部长什么样";大模型层回答"现在主流的生成式系统怎么工作";评估层回答"怎么判断好坏、怎么发现偏见和幻觉";工程层回答"怎么把它跑起来、跑得快、跑在边缘设备上";职业层回答"这些岗位和认证分别叫什么"。
使用方式上,我建议你分两遍看。第一遍顺着读,不求记住,只求知道"原来还有这么个东西",建立索引。第二遍是遇到具体问题时回来查,这时候你已经有了上下文,记忆会牢固得多。表格里的"我的理解"那一列是刻意写成口语的,因为它比标准定义更容易在脑子里留下钩子。
提示:术语表最大的价值不是背下来,而是让你在读到陌生词时知道自己该去哪一层找它。定位能力比记忆能力重要。
2. 基础概念层:先把地基上的词认全
2.1 学科与范式类术语
这一层的词决定了你怎么理解整件事。人工智能(Artificial Intelligence, AI)是最大的集合,指让机器表现出类似智能行为的所有努力。它下面分出去两条历史路线:一条是符号主义(Symbolic AI),靠规则和逻辑推理,典型产物是专家系统(Expert System);另一条是联结主义(Connectionism),靠大量简单单元的连接和权重调整,也就是今天的神经网络(Neural Network, NN)。这两条路线此消彼长了几十年,现在主流是联结主义占上风,但符号方法并没有消失,它以知识图谱(Knowledge Graph)和本体(Ontology)的形式重新回到系统里,用来做约束和事实校验。
本体(Ontology)这个词特别值得单独说一句。它在哲学里译作"本体论",在人工智能里指的是对某个领域概念及其关系的形式化描述规范。你可以把它理解成"给一个行业定一套带层级的词汇表和关系规则",比如"感冒是一种疾病""疾病有症状"这样的结构。它和知识图谱的关系是:本体是骨架和语法,知识图谱是填充进去的实例数据。近几年做智能体系统时,本体又被重新提起,原因是大模型的记忆和检索需要一个稳定的结构化底座,否则多轮对话里它自己就会把概念搞混。
通用人工智能(Artificial General Intelligence, AGI)和专用人工智能(Narrow AI)的区分也要清楚。今天你能用到的所有系统,包括各种大模型,都属于专用范畴——它们在特定任务上很强,但没有跨领域的自主迁移能力。具身智能(Embodied Intelligence)则是另一条线,强调智能必须依附于身体和环境的交互,机器人抓取、导航这类任务都属于它。
| 中文 | 英文 | 我的理解 |
|---|---|---|
| 人工智能 | Artificial Intelligence, AI | 让机器表现出智能行为的总称 |
| 机器学习 | Machine Learning, ML | 不写死规则,让模型从数据里找规律 |
| 深度学习 | Deep Learning, DL | 用多层神经网络做机器学习 |
| 符号主义 | Symbolic AI | 靠规则和逻辑,老派但没死 |
| 联结主义 | Connectionism | 靠连接和权重,现在的主流 |
| 专家系统 | Expert System | 把专家经验写成规则的早期系统 |
| 本体 | Ontology | 一个领域的概念和关系规范 |
| 知识图谱 | Knowledge Graph | 按本体填好的实体关系网络 |
| 通用人工智能 | Artificial General Intelligence, AGI | 能跨领域自主迁移的目标形态 |
| 专用人工智能 | Narrow AI | 只擅长特定任务,今天都是它 |
| 具身智能 | Embodied Intelligence | 有身体、靠交互学出来的智能 |
2.2 学习范式与训练方式术语
这一组词是你读论文时出现频率最高的。监督学习(Supervised Learning)用带标签的数据,无监督学习(Unsupervised Learning)不带标签,自监督学习(Self-supervised Learning)是自己从数据里造标签——比如把句子里的某个词遮住让模型猜,标签是数据自带的,不需要人工标注。今天的大语言模型预训练几乎全是自监督,这是它能吃下海量文本的关键。
强化学习(Reinforcement Learning, RL)是另一个体系,靠奖励信号引导行为,不依赖标准答案。基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF)就是把人的偏好排序当作奖励来源,用来让模型输出更符合人类期待。后来为了降低成本,出现了基于AI反馈的强化学习(RLAIF),让另一个模型来打分。
迁移学习(Transfer Learning)和微调(Fine-tuning)是一对。前者强调把在一个任务上学到的知识搬到另一个任务,后者是具体的操作手段。零样本(Zero-shot)、单样本(One-shot)、少样本(Few-shot)描述的是给模型看几个例子就让它干活,上下文学习(In-context Learning)是这种现象的学名——模型参数没变,只靠提示里的例子就调整了行为。元学习(Meta-Learning)是"学会学习",课程学习(Curriculum Learning)是按难度顺序喂数据,知识蒸馏(Knowledge Distillation)是让小模型模仿大模型的输出分布。
这里有个常见误解要提前纠正:很多人把 Few-shot 和微调混为一谈。Few-shot 不改参数,只改输入;微调改参数,要重新训练。前者便宜灵活,后者稳定但成本高。选哪个,取决于你的任务稳定性和调用频率。
2.3 数据相关术语
数据这一层的词汇看起来朴素,但出错率最高。数据集(Dataset)通常切成训练集(Training Set)、验证集(Validation Set)、测试集(Test Set)三份。验证集用来调超参数,测试集只在最后用一次。我见过不少人反复用测试集调参,结果报出来的指标虚高得离谱。
标签(Label)和标注(Annotation)是两个动作的产物和过程。真值(Ground Truth)是理论上正确的答案,注意它不等于"绝对真理",只是你这份数据集里被认可的标准。特征(Feature)是喂给模型的输入描述,嵌入(Embedding)是把离散对象映射成稠密向量,词元(Token)是文本被切分后的最小单位,分词(Tokenization)就是切分这个过程,词表(Vocabulary)是切分后所有可能单位的集合。
数据增强(Data Augmentation)在不改变语义的前提下扩充样本,图像里常见的是翻转裁剪,文本里常见的是同义替换和回译。数据泄漏(Data Leakage)是训练时不小心混入了测试信息,是导致指标虚高的头号隐形杀手。类别不平衡(Class Imbalance)指某类样本远多于其他类,会让模型偏向多数类。
| 中文 | 英文 | 我的理解 |
|---|---|---|
| 数据集 | Dataset | 样本的集合 |
| 训练集 | Training Set | 用来学参数 |
| 验证集 | Validation Set | 用来调超参数 |
| 测试集 | Test Set | 最后只用一次,别反复用 |
| 标签 | Label | 样本对应的答案 |
| 标注 | Annotation | 人工或半自动打标签的过程 |
| 真值 | Ground Truth | 数据集内被认可的标准答案 |
| 特征 | Feature | 描述样本的输入信息 |
| 嵌入 | Embedding | 对象变成稠密向量 |
| 词元 | Token | 文本切分后的最小单位 |
| 分词 | Tokenization | 把文本切成词元 |
| 词表 | Vocabulary | 所有词元的集合 |
| 数据增强 | Data Augmentation | 不改语义地扩样本 |
| 数据泄漏 | Data Leakage | 训练时混进了测试信息 |
| 类别不平衡 | Class Imbalance | 某些类样本特别少 |
3. 网络结构层:模型内部到底长什么样
3.1 基础组件与训练机制术语
理解神经网络,先认三个结构词:输入层(Input Layer)、隐藏层(Hidden Layer)、输出层(Output Layer)。层与层之间靠权重(Weight)和偏置(Bias)连接,这两类东西统称参数(Parameter),是训练要自动学出来的。而超参数(Hyperparameter)是你必须自己定的,比如层数、学习率、批大小,它们不参与梯度更新。
激活函数(Activation Function)给网络引入非线性,没有它,再深的网络也等价于一个线性变换。常见的几个:Sigmoid输出 0 到 1,适合二分类末端;Tanh输出 -1 到 1;ReLU计算简单、缓解梯度消失,是卷积网络的默认选择;GELU更平滑,是 Transformer 里的常见配置;Softmax把一组数值变成概率分布,用在多分类输出。
反向传播(Backpropagation)是计算梯度的算法,梯度下降(Gradient Descent)是沿着梯度更新参数的策略,随机梯度下降(Stochastic Gradient Descent, SGD)每次只用一小批数据估梯度。批(Batch)是一次前向传播处理的样本数,批大小(Batch Size)就是它的数量,轮次(Epoch)是把整个训练集过一遍,迭代(Iteration)是处理完一个批次。学习率(Learning Rate)决定每步走多远,太大容易震荡不收敛,太小训练慢得让人怀疑人生。
过拟合(Overfitting)是训练集表现好、测试集拉胯,欠拟合(Underfitting)是两边都差。应对手段有正则化(Regularization)、随机失活(Dropout)、批归一化(Batch Normalization)、层归一化(Layer Normalization)。残差连接(Residual Connection)让梯度能跨层直接回传,是深层网络能训起来的关键设计。
注意:学习率不是越调越小就越好。很多人一遇到不收敛就把学习率砍十倍,结果训练十轮还在原地。先看损失曲线形状,再决定是调学习率还是换优化器。
3.2 经典网络与 Transformer 架构术语
经典架构先认识五个。多层感知机(Multilayer Perceptron, MLP)是最基础的全连接网络。卷积神经网络(Convolutional Neural Network, CNN)靠卷积核提取局部特征,图像任务的老牌主力。循环神经网络(Recurrent Neural Network, RNN)处理序列,但长距离依赖容易忘。长短期记忆网络(Long Short-Term Memory, LSTM)和门控循环单元(Gated Recurrent Unit, GRU)是它的改良版,用门控机制控制信息保留。生成对抗网络(Generative Adversarial Network, GAN)用生成器和判别器互相博弈,变分自编码器(Variational Autoencoder, VAE)走概率建模路线,扩散模型(Diffusion Model)靠逐步去噪生成,是当前图像生成的主流。
Transformer这一套必须单独拆开讲。注意力(Attention)是让模型根据相关性给不同位置分配权重的机制。自注意力(Self-Attention)是序列内部自己算注意力,多头注意力(Multi-Head Attention)是并行做多组,捕捉不同子空间的关系。位置编码(Positional Encoding)是补上顺序信息,因为注意力本身不区分先后。编码器-解码器(Encoder-Decoder)是两种结构的组合,编码器负责理解,解码器负责生成。前馈网络(Feed Forward Network)是注意力层后面那个逐位置变换的模块。
再往上是工程化的词。混合专家(Mixture of Experts, MoE)把模型切成多个专家子网络,每次只激活一部分,用参数量换计算效率。上下文窗口(Context Window)是模型一次能看进去的词元上限。KV缓存(KV Cache)是推理时把已算过的键值存下来复用,不做这个优化,长文本生成会慢到无法接受。
| 中文 | 英文 | 我的理解 |
|---|---|---|
| 卷积神经网络 | Convolutional Neural Network, CNN | 提局部特征,图像主力 |
| 循环神经网络 | Recurrent Neural Network, RNN | 处理序列,但记性差 |
| 长短期记忆网络 | Long Short-Term Memory, LSTM | 带门控的序列模型 |
| 生成对抗网络 | Generative Adversarial Network, GAN | 生成器和判别器互搏 |
| 变分自编码器 | Variational Autoencoder, VAE | 概率路线的生成模型 |
| 扩散模型 | Diffusion Model | 逐步去噪生成,当前主流 |
| 注意力 | Attention | 按相关性分配权重 |
| 自注意力 | Self-Attention | 序列内部算注意力 |
| 多头注意力 | Multi-Head Attention | 并行多组,抓不同关系 |
| 位置编码 | Positional Encoding | 补上顺序信息 |
| 混合专家 | Mixture of Experts, MoE | 只激活部分专家省算力 |
| 上下文窗口 | Context Window | 一次能看多少词元 |
| 键值缓存 | KV Cache | 缓存历史结果加速生成 |
4. 大模型与生成式人工智能层
4.1 模型层级与训练阶段术语
大语言模型(Large Language Model, LLM)指参数量大、在海量文本上训练的语言模型。基础模型(Foundation Model)是更宽的叫法,泛指能迁移到多种下游任务的大规模预训练模型,不限于语言。训练阶段分两大段:预训练(Pre-training)在海量无标注数据上做自监督学习,目的是获得通用表示能力;后训练(Post-training)在预训练之后做定向调整,包括监督微调(Supervised Fine-Tuning, SFT)、指令微调(Instruction Tuning)和对齐(Alignment)。
对齐这个词容易被误解成"让模型听话",其实它的目标是让模型的行为与人类价值观和意图一致,涵盖有用性、诚实性和无害性几个维度。对齐做过头会出现对齐税(Alignment Tax),也就是模型变得过度保守,该答的也不答了。灾难性遗忘(Catastrophic Forgetting)是微调后模型丢掉了预训练阶段学到的通用能力,这是持续学习里的经典难题。
微调手段上,全参数微调成本高,所以有了参数高效微调(Parameter-Efficient Fine-Tuning, PEFT),代表方法是低秩适配(Low-Rank Adaptation, LoRA),思路是冻结原权重,只训练一对低秩矩阵,用极少的参数达到接近全量微调的效果。推理部署阶段还有量化(Quantization)、剪枝(Pruning)、知识蒸馏三件套来压缩模型体积。
4.2 提示、生成控制与检索增强术语
提示词(Prompt)是给模型的输入指令,提示工程(Prompt Engineering)是设计这些输入的方法论,系统提示(System Prompt)是设定角色和边界的顶层指令。思维链(Chain of Thought, CoT)是让模型把推理步骤写出来再给答案,对数学和逻辑题效果明显。
生成控制参数必须认识三个。温度(Temperature)控制随机性,接近 0 时输出最确定,调高会更发散;Top-k 采样只在概率最高的 k 个候选里挑;Top-p 采样,也叫核采样(Nucleus Sampling),按累积概率截断候选集合。贪心解码(Greedy Decoding)每步都选概率最高的词,束搜索(Beam Search)同时保留多条候选路径,适合翻译这类需要整体最优的任务。
生成式系统最该警惕的词是幻觉(Hallucination),指模型编造出看起来合理但实际错误的内容。对应的缓解思路叫接地(Grounding),让输出锚定在可验证的来源上。检索增强生成(Retrieval-Augmented Generation, RAG)是当前最常用的接地方案,流程是先把文档切成分块(Chunking),编码后存进向量数据库(Vector Database),检索时做语义搜索(Semantic Search),召回结果再经过重排序(Re-ranking)后塞进提示。
再往上一层是智能体(Agent),指能自主规划、调用工具调用(Tool Use / Function Calling)、并根据反馈调整的模型系统。多智能体协作叫多智能体(Multi-Agent),其中承担规划职责的模块常叫规划器(Planner),保存历史信息的模块叫记忆(Memory)。
| 中文 | 英文 | 我的理解 |
|---|---|---|
| 大语言模型 | Large Language Model, LLM | 参数大、文本量大训出来的模型 |
| 基础模型 | Foundation Model | 能迁移到多任务的大模型 |
| 预训练 | Pre-training | 海量无标注数据自监督学习 |
| 监督微调 | Supervised Fine-Tuning, SFT | 用标注数据做定向调整 |
| 对齐 | Alignment | 让行为符合人类意图 |
| 低秩适配 | Low-Rank Adaptation, LoRA | 冻结原权重只训小矩阵 |
| 量化 | Quantization | 降低数值精度省显存 |
| 温度 | Temperature | 控制输出随机性 |
| 核采样 | Nucleus Sampling, Top-p | 按累积概率截断候选 |
| 思维链 | Chain of Thought, CoT | 先写推理再给答案 |
| 幻觉 | Hallucination | 编造看似合理的内容 |
| 检索增强生成 | Retrieval-Augmented Generation, RAG | 先检索再生成,抑制幻觉 |
| 智能体 | Agent | 能规划、调工具、自我调整的系统 |
5. 评估、偏见与常见误用术语
5.1 评估指标术语
准确率(Accuracy)是最直观的指标,但在类别不平衡时极具欺骗性——负样本占 99% 的数据集,全猜负类也能有 0.99。所以要看精确率(Precision),即预测为正的样本里真正为正的比例;召回率(Recall),即真正的正样本被找出来的比例;以及两者的调和平均F1 分数(F1 Score)。混淆矩阵(Confusion Matrix)把四类结果排列出来,是排查问题最直接的工具。ROC 曲线和AUC衡量排序能力,与阈值无关。
生成任务里常用困惑度(Perplexity, PPL)衡量语言模型对文本的"意外程度",越低说明预测越准。翻译和摘要用BLEU和ROUGE衡量与参考文本的重合度,注意它们只看字面重合,不理解语义。检测和分割任务看交并比(Intersection over Union, IoU)和平均精度均值(mean Average Precision, mAP)。基准测试(Benchmark)是统一评测集合,基线(Baseline)是对比参照,消融实验(Ablation Study)是逐个去掉模块看影响,交叉验证(Cross-Validation)是轮换验证集以减少划分偶然性。
5.2 偏见、安全与鲁棒性术语
偏见(Bias)在人工智能语境里有两种含义,一种是统计意义上的偏差,另一种是模型输出对特定群体不公平,公平性(Fairness)就是衡量和缓解后者的研究方向。偏见的来源通常是训练数据本身,模型只是把数据里的倾向放大了。鲁棒性(Robustness)指模型面对扰动、噪声、分布外输入时保持稳定的能力,对抗样本(Adversarial Example)是专门构造出来骗过模型的输入。
可解释性(Explainability)和可解释性(Interpretability)常被混用,前者偏重事后给出解释,后者偏重模型本身结构上就能被理解。安全侧还有红队测试(Red Teaming),即主动扮演攻击方找漏洞,以及越狱(Jailbreak),指绕过模型安全限制的提示手法。
| 中文 | 英文 | 我的理解 |
|---|---|---|
| 准确率 | Accuracy | 最直观但在不平衡时骗人 |
| 精确率 | Precision | 预测为正里有多少真为正 |
| 召回率 | Recall | 真正的正样本找出来多少 |
| F1 分数 | F1 Score | 精确率和召回率的调和平均 |
| 混淆矩阵 | Confusion Matrix | 四类结果排开看 |
| 困惑度 | Perplexity, PPL | 语言模型的意外程度 |
| 交并比 | Intersection over Union, IoU | 检测框重叠程度 |
| 消融实验 | Ablation Study | 逐个去掉模块看影响 |
| 偏见 | Bias | 数据倾向被模型放大 |
| 鲁棒性 | Robustness | 面对扰动保持稳定 |
| 对抗样本 | Adversarial Example | 专门构造来骗模型的输入 |
| 红队测试 | Red Teaming | 主动扮攻击方找漏洞 |
5.3 术语误用速查
有几个词我几乎每次交流都能听到被用错,列出来对照一下。第一组是参数和超参数,前者训练学,后者人手定,写实验记录时千万别混。第二组是验证集和测试集,前者可以反复用来调,后者只能用一次,反复用测试集调参等于自己骗自己。第三组是Epoch和Iteration,一个轮次包含多个迭代,汇报训练进度时说错会被直接看出底子。
第四组是微调和提示工程,前者改参数,后者不改,成本差好几个量级。第五组是准确率和精度,中文里"精度"有时指 precision,有时泛指 accuracy,讨论时最好直接说英文或写清楚定义。第六组是训练和推理,一个在学习,一个在使用,很多资源估算的错误都出在把两者混着算。
提示:跟别人讨论指标时,养成先说数据集分布、再说指标名称的习惯。脱离分布谈准确率,基本没有意义。
6. 工程落地、职业与学习路径词汇
6.1 部署与推理优化术语
推理(Inference)是模型跑起来给结果的过程,和训练相对。衡量推理的两个核心指标是延迟(Latency)和吞吐量(Throughput),前者看单次响应多快,后者看单位时间能处理多少请求,两者经常互相牵制。浮点运算次数(FLOPs)用来估算计算量。硬件侧常见图形处理器(GPU)、张量处理器(TPU)、神经网络处理器(NPU),以及 NVIDIA 的并行计算平台CUDA。
模型交换格式有开放神经网络交换格式(Open Neural Network Exchange, ONNX),推理加速有TensorRT,高吞吐服务有vLLM。批推理(Batch Inference)把多个请求合并处理以提高吞吐,代价是单请求延迟上升。模型服务(Model Serving)是把模型包装成接口的工程环节,机器学习运维(MLOps)是覆盖训练、部署、监控、回滚的全流程实践。联邦学习(Federated Learning)让数据留在本地,只上传模型更新;差分隐私(Differential Privacy)通过在统计结果里加噪声保护个体信息。
6.2 边缘计算与具身智能相关术语
边缘计算(Edge Computing)是把计算放到靠近数据源的一侧,边缘人工智能(Edge AI)就是在这类设备上跑模型。它的核心矛盾是算力、功耗、内存三者都紧,所以必须配合模型压缩(Model Compression),包括量化、剪枝和蒸馏。微型机器学习(TinyML)指在单片机和超低功耗设备上跑的模型。开发板里Jetson Nano是入门常见选择,配套的部署流程基本是导出 ONNX、再转 TensorRT 引擎、最后做量化校准。
具身智能方向还要认几个词:机器人学(Robotics)是学科总称,同步定位与建图(Simultaneous Localization and Mapping, SLAM)解决"我在哪、周围什么样",操作(Manipulation)指抓取和操控物体,仿真到现实迁移(Sim-to-Real)指在仿真里训练、迁移到真机上,数字孪生(Digital Twin)是物理实体的虚拟映射,用来做低成本试错。
6.3 职业、认证与学习路径术语
岗位名称先对齐。人工智能训练师对应AI Trainer,工作内容偏数据标注策略、评测设计和模型行为调优,现在已有分级认证体系,三级通常要求能独立设计标注规范和评测方案。数据标注员(Data Annotator)偏执行层。算法工程师(Algorithm Engineer)偏模型设计和实验。机器学习工程师(Machine Learning Engineer)偏工程化落地。提示工程师(Prompt Engineer)专注输入设计。生成式人工智能应用工程师侧重把生成式能力接进具体业务系统。人工智能产品经理(AI Product Manager)负责需求定义和效果验收。人工智能伦理(AI Ethics)是研究与应用中的规范方向。
学习路径上,我建议按人工智能基础到人工智能导论到专项深入的顺序走,不要一上来就啃大模型论文。人工智能基础概念和人工智能基础知识这两块打牢,后面看任何方向都会快。如果是为了做人工智能毕业设计或人工智能大作业,优先选有公开数据集、有可比基线、评测指标明确的任务,比如经典的猫狗识别这类图像分类,虽然简单,但全流程跑通一遍的价值远大于追热点。
认证方面,华为人工智能初识微认证这类入门级认证适合建立框架,高级别的生成式应用工程师认证更适合已经上手做过项目的人。
| 中文 | 英文 | 我的理解 |
|---|---|---|
| 推理 | Inference | 模型跑起来出结果 |
| 延迟 | Latency | 单次响应耗时 |
| 吞吐量 | Throughput | 单位时间处理请求数 |
| 浮点运算次数 | FLOPs | 估算计算量 |
| 边缘人工智能 | Edge AI | 在靠近数据源的设备上跑模型 |
| 模型压缩 | Model Compression | 量化剪枝蒸馏三件套 |
| 微型机器学习 | TinyML | 超低功耗设备上的模型 |
| 同步定位与建图 | SLAM | 我在哪、周围什么样 |
| 仿真到现实迁移 | Sim-to-Real | 仿真训练、真机部署 |
| 数字孪生 | Digital Twin | 物理实体的虚拟映射 |
| 人工智能训练师 | AI Trainer | 标注策略、评测设计、行为调优 |
| 算法工程师 | Algorithm Engineer | 模型设计与实验 |
7. 术语记忆与查阅的实操方法
7.1 三层记忆法
背术语最忌讳平铺直叙地刷表,刷完一遍什么也留不下。我自己的做法是分三层。第一层是场景层:每个术语必须挂在一个具体场景上,比如"数据泄漏"挂在我曾经把测试集混进训练集导致指标虚高 0.15 的那次事故上。有场景的词,回忆时是顺着故事出来的,比孤立记忆牢固得多。
第二层是对照层:把容易混的成对术语写成两列表格,逼自己写清楚差别。比如参数对超参数、验证集对测试集、微调对提示工程、精确率对召回率。这个动作看起来笨,但它把"我大概知道"变成了"我能说清",而后者才是能在面试和写作里用得上的。
第三层是输出层:用自己的话给一个完全不懂的人解释这个术语,不许用行话。如果你讲"自监督学习"时只能说"就是自己监督自己",说明还没真懂。讲成"把句子里的词遮住让模型猜,答案从原文里来,不用人标",才算过了这关。
7.2 高频踩坑与排查
第一类坑是中英文不对应。有些词中文有多个译法,比如 Grounding 有人译"接地",有人译"事实锚定",有人干脆不译。遇到这种情况,我的做法是记住英文原词,中文只当辅助,搜索文献时一律用英文。这样能避开大量同名不同义的混乱。
第二类坑是缩写撞车。AI 既是 Artificial Intelligence,在某些语境下也指 Adobe Illustrator;ML 既是 Machine Learning,也出现在其他领域;Transformer 既是模型架构,也是别的技术名。查资料时把领域词一起带上,比如"Transformer 注意力机制",命中率会高很多。
第三类坑是版本漂移。同一个术语在不同阶段的含义会变。比如"对齐"在早期指格式对齐,现在主要指价值对齐;"智能体"在符号主义时代指规则驱动的软件实体,现在指大模型驱动的自主系统。读老文献时要注意这一点,别拿今天的定义去套十年前的论文。
第四类坑是术语堆砌造成的虚假理解。有些人能连续说出"多模态、具身、世界模型、端到端"一串词,但问其中任何一个的具体输入输出是什么就答不上来。判断自己是否真懂一个术语,用一句话测试:它的输入是什么、输出是什么、解决什么问题、代价是什么。四个问题答不上两个,就是还没懂。
注意:术语表是地图不是领土。看懂地图不等于走过路,最终还是要落到一个能跑起来的项目上。
我在实际整理和使用这份表的过程中,最大的体会是:术语的价值不在于它听起来专业,而在于它能压缩沟通成本。同一个概念,你用一句话说清,别人省下十分钟理解时间,长期累积下来就是效率差距。另外提一句小技巧,我会在术语表里给每个词标一个"首次遇到时间",半年后回看,哪些词反复出现在不同项目里,哪些词只出现过一次,这个分布本身就能告诉你自己的知识结构偏在哪、缺在哪。这份表你不需要一次背完,把它当成工具箱,用到哪一层翻哪一层,用着用着就长在脑子里了。