☰
人工智能专业术语表中英文对照:大模型、评估与工程落地全覆盖
2026/10/2 5:18:17 网站建设 项目流程

很多人卡在人工智能这条路上,不是因为数学不够好,也不是因为代码写不出来,而是被术语绊住了。读一篇论文,摘要里五个词组有四个要查;看官方文档,"指令微调""对齐""上下文学习"混在一起,不知道哪个是训练阶段哪个是推理技巧;面试被问一句"你了解自监督预训练吗",脑子里先蹦出来的是"self-supervised"这个英文单词,而不是它到底在做什么。这就是我动手整理这份**人工智能专业术语表(中英文对照)**的直接原因。这份表覆盖基础概念、网络结构、大模型、评估指标、工程落地、职业认证六个层面,每个术语都给中文名、英文名,外加一句"人话解释"。它适合三类人:刚入门想建立框架的学生,做项目需要快速对齐词汇的工程师,以及要写大作业、准备面试、考认证的人。我尽量不写成字典,而是写成一份可以直接拿来用的工具。

1. 为什么术语表比教程更该先看

1.1 术语混乱带来的真实麻烦

我先说一个很具体的场景。有次带一个刚转方向的同学做文本分类项目,他跑通了代码,准确率也有 0.9,但复盘的时候说不清楚自己做了什么。问他"你用的是交叉验证还是固定划分",他答"我就是随机分的"。问他"F1 是多少",他答"我只看准确率"。这不是能力问题,是词汇没对齐导致的表达失能——他知道自己在做什么,但没有对应的术语去指称它,所以在沟通和写作时全部塌陷成"我就是那样做的"。

术语混乱还有更隐蔽的代价。人工智能领域有个特点:同一个概念在不同圈层有不同叫法。学术界叫Representation Learning(表示学习),工程界常说Feature Extraction(特征提取),到了产品文档里又变成"语义理解"。你要是不建立一张对照表,就会以为是三个东西,结果重复学了三遍。反过来,有些词看着像同义词,实际差得很远,比如Parameter(参数)和Hyperparameter(超参数),一个由训练自动学出来,一个必须你自己设定,混用会让你的实验记录完全失去可复现性。

我自己的做法是,每进入一个新子领域,先花两个小时只做一件事:把该领域高频出现的三十到五十个术语抄下来,写下中英文和一句话解释,然后再去读教程。这个顺序反过来做,效率会低很多,因为教程默认你已经懂了那些词。

1.2 这份表的组织逻辑与使用方式

这份表的组织逻辑是按"从地基到楼顶"排的,不是按字母排。字母序适合查阅,不适合建立认知。我把它分成六层:基础概念层回答"这是什么学科、怎么学";网络结构层回答"模型内部长什么样";大模型层回答"现在主流的生成式系统怎么工作";评估层回答"怎么判断好坏、怎么发现偏见和幻觉";工程层回答"怎么把它跑起来、跑得快、跑在边缘设备上";职业层回答"这些岗位和认证分别叫什么"。

使用方式上,我建议你分两遍看。第一遍顺着读,不求记住,只求知道"原来还有这么个东西",建立索引。第二遍是遇到具体问题时回来查,这时候你已经有了上下文,记忆会牢固得多。表格里的"我的理解"那一列是刻意写成口语的,因为它比标准定义更容易在脑子里留下钩子。

提示:术语表最大的价值不是背下来,而是让你在读到陌生词时知道自己该去哪一层找它。定位能力比记忆能力重要。

2. 基础概念层:先把地基上的词认全

2.1 学科与范式类术语

这一层的词决定了你怎么理解整件事。人工智能(Artificial Intelligence, AI)是最大的集合,指让机器表现出类似智能行为的所有努力。它下面分出去两条历史路线:一条是符号主义(Symbolic AI),靠规则和逻辑推理,典型产物是专家系统(Expert System);另一条是联结主义(Connectionism),靠大量简单单元的连接和权重调整,也就是今天的神经网络(Neural Network, NN)。这两条路线此消彼长了几十年,现在主流是联结主义占上风,但符号方法并没有消失,它以知识图谱(Knowledge Graph)和本体(Ontology)的形式重新回到系统里,用来做约束和事实校验。

本体(Ontology)这个词特别值得单独说一句。它在哲学里译作"本体论",在人工智能里指的是对某个领域概念及其关系的形式化描述规范。你可以把它理解成"给一个行业定一套带层级的词汇表和关系规则",比如"感冒是一种疾病""疾病有症状"这样的结构。它和知识图谱的关系是:本体是骨架和语法,知识图谱是填充进去的实例数据。近几年做智能体系统时,本体又被重新提起,原因是大模型的记忆和检索需要一个稳定的结构化底座,否则多轮对话里它自己就会把概念搞混。

通用人工智能(Artificial General Intelligence, AGI)和专用人工智能(Narrow AI)的区分也要清楚。今天你能用到的所有系统,包括各种大模型,都属于专用范畴——它们在特定任务上很强,但没有跨领域的自主迁移能力。具身智能(Embodied Intelligence)则是另一条线,强调智能必须依附于身体和环境的交互,机器人抓取、导航这类任务都属于它。

中文英文我的理解
人工智能Artificial Intelligence, AI让机器表现出智能行为的总称
机器学习Machine Learning, ML不写死规则,让模型从数据里找规律
深度学习Deep Learning, DL用多层神经网络做机器学习
符号主义Symbolic AI靠规则和逻辑,老派但没死
联结主义Connectionism靠连接和权重,现在的主流
专家系统Expert System把专家经验写成规则的早期系统
本体Ontology一个领域的概念和关系规范
知识图谱Knowledge Graph按本体填好的实体关系网络
通用人工智能Artificial General Intelligence, AGI能跨领域自主迁移的目标形态
专用人工智能Narrow AI只擅长特定任务,今天都是它
具身智能Embodied Intelligence有身体、靠交互学出来的智能

2.2 学习范式与训练方式术语

这一组词是你读论文时出现频率最高的。监督学习(Supervised Learning)用带标签的数据,无监督学习(Unsupervised Learning)不带标签,自监督学习(Self-supervised Learning)是自己从数据里造标签——比如把句子里的某个词遮住让模型猜,标签是数据自带的,不需要人工标注。今天的大语言模型预训练几乎全是自监督,这是它能吃下海量文本的关键。

强化学习(Reinforcement Learning, RL)是另一个体系,靠奖励信号引导行为,不依赖标准答案。基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF)就是把人的偏好排序当作奖励来源,用来让模型输出更符合人类期待。后来为了降低成本,出现了基于AI反馈的强化学习(RLAIF),让另一个模型来打分。

迁移学习(Transfer Learning)和微调(Fine-tuning)是一对。前者强调把在一个任务上学到的知识搬到另一个任务,后者是具体的操作手段。零样本(Zero-shot)、单样本(One-shot)、少样本(Few-shot)描述的是给模型看几个例子就让它干活,上下文学习(In-context Learning)是这种现象的学名——模型参数没变,只靠提示里的例子就调整了行为。元学习(Meta-Learning)是"学会学习",课程学习(Curriculum Learning)是按难度顺序喂数据,知识蒸馏(Knowledge Distillation)是让小模型模仿大模型的输出分布。

这里有个常见误解要提前纠正:很多人把 Few-shot 和微调混为一谈。Few-shot 不改参数,只改输入;微调改参数,要重新训练。前者便宜灵活,后者稳定但成本高。选哪个,取决于你的任务稳定性和调用频率。

2.3 数据相关术语

数据这一层的词汇看起来朴素,但出错率最高。数据集(Dataset)通常切成训练集(Training Set)、验证集(Validation Set)、测试集(Test Set)三份。验证集用来调超参数,测试集只在最后用一次。我见过不少人反复用测试集调参,结果报出来的指标虚高得离谱。

标签(Label)和标注(Annotation)是两个动作的产物和过程。真值(Ground Truth)是理论上正确的答案,注意它不等于"绝对真理",只是你这份数据集里被认可的标准。特征(Feature)是喂给模型的输入描述,嵌入(Embedding)是把离散对象映射成稠密向量,词元(Token)是文本被切分后的最小单位,分词(Tokenization)就是切分这个过程,词表(Vocabulary)是切分后所有可能单位的集合。

数据增强(Data Augmentation)在不改变语义的前提下扩充样本,图像里常见的是翻转裁剪,文本里常见的是同义替换和回译。数据泄漏(Data Leakage)是训练时不小心混入了测试信息,是导致指标虚高的头号隐形杀手。类别不平衡(Class Imbalance)指某类样本远多于其他类,会让模型偏向多数类。

中文英文我的理解
数据集Dataset样本的集合
训练集Training Set用来学参数
验证集Validation Set用来调超参数
测试集Test Set最后只用一次,别反复用
标签Label样本对应的答案
标注Annotation人工或半自动打标签的过程
真值Ground Truth数据集内被认可的标准答案
特征Feature描述样本的输入信息
嵌入Embedding对象变成稠密向量
词元Token文本切分后的最小单位
分词Tokenization把文本切成词元
词表Vocabulary所有词元的集合
数据增强Data Augmentation不改语义地扩样本
数据泄漏Data Leakage训练时混进了测试信息
类别不平衡Class Imbalance某些类样本特别少

3. 网络结构层:模型内部到底长什么样

3.1 基础组件与训练机制术语

理解神经网络,先认三个结构词:输入层(Input Layer)、隐藏层(Hidden Layer)、输出层(Output Layer)。层与层之间靠权重(Weight)和偏置(Bias)连接,这两类东西统称参数(Parameter),是训练要自动学出来的。而超参数(Hyperparameter)是你必须自己定的,比如层数、学习率、批大小,它们不参与梯度更新。

激活函数(Activation Function)给网络引入非线性,没有它,再深的网络也等价于一个线性变换。常见的几个:Sigmoid输出 0 到 1,适合二分类末端;Tanh输出 -1 到 1;ReLU计算简单、缓解梯度消失,是卷积网络的默认选择;GELU更平滑,是 Transformer 里的常见配置;Softmax把一组数值变成概率分布,用在多分类输出。

反向传播(Backpropagation)是计算梯度的算法,梯度下降(Gradient Descent)是沿着梯度更新参数的策略,随机梯度下降(Stochastic Gradient Descent, SGD)每次只用一小批数据估梯度。批(Batch)是一次前向传播处理的样本数,批大小(Batch Size)就是它的数量,轮次(Epoch)是把整个训练集过一遍,迭代(Iteration)是处理完一个批次。学习率(Learning Rate)决定每步走多远,太大容易震荡不收敛,太小训练慢得让人怀疑人生。

过拟合(Overfitting)是训练集表现好、测试集拉胯,欠拟合(Underfitting)是两边都差。应对手段有正则化(Regularization)、随机失活(Dropout)、批归一化(Batch Normalization)、层归一化(Layer Normalization)。残差连接(Residual Connection)让梯度能跨层直接回传,是深层网络能训起来的关键设计。

注意:学习率不是越调越小就越好。很多人一遇到不收敛就把学习率砍十倍,结果训练十轮还在原地。先看损失曲线形状,再决定是调学习率还是换优化器。

3.2 经典网络与 Transformer 架构术语

经典架构先认识五个。多层感知机(Multilayer Perceptron, MLP)是最基础的全连接网络。卷积神经网络(Convolutional Neural Network, CNN)靠卷积核提取局部特征,图像任务的老牌主力。循环神经网络(Recurrent Neural Network, RNN)处理序列,但长距离依赖容易忘。长短期记忆网络(Long Short-Term Memory, LSTM)和门控循环单元(Gated Recurrent Unit, GRU)是它的改良版,用门控机制控制信息保留。生成对抗网络(Generative Adversarial Network, GAN)用生成器和判别器互相博弈,变分自编码器(Variational Autoencoder, VAE)走概率建模路线,扩散模型(Diffusion Model)靠逐步去噪生成,是当前图像生成的主流。

Transformer这一套必须单独拆开讲。注意力(Attention)是让模型根据相关性给不同位置分配权重的机制。自注意力(Self-Attention)是序列内部自己算注意力,多头注意力(Multi-Head Attention)是并行做多组,捕捉不同子空间的关系。位置编码(Positional Encoding)是补上顺序信息,因为注意力本身不区分先后。编码器-解码器(Encoder-Decoder)是两种结构的组合,编码器负责理解,解码器负责生成。前馈网络(Feed Forward Network)是注意力层后面那个逐位置变换的模块。

再往上是工程化的词。混合专家(Mixture of Experts, MoE)把模型切成多个专家子网络,每次只激活一部分,用参数量换计算效率。上下文窗口(Context Window)是模型一次能看进去的词元上限。KV缓存(KV Cache)是推理时把已算过的键值存下来复用,不做这个优化,长文本生成会慢到无法接受。

中文英文我的理解
卷积神经网络Convolutional Neural Network, CNN提局部特征,图像主力
循环神经网络Recurrent Neural Network, RNN处理序列,但记性差
长短期记忆网络Long Short-Term Memory, LSTM带门控的序列模型
生成对抗网络Generative Adversarial Network, GAN生成器和判别器互搏
变分自编码器Variational Autoencoder, VAE概率路线的生成模型
扩散模型Diffusion Model逐步去噪生成,当前主流
注意力Attention按相关性分配权重
自注意力Self-Attention序列内部算注意力
多头注意力Multi-Head Attention并行多组,抓不同关系
位置编码Positional Encoding补上顺序信息
混合专家Mixture of Experts, MoE只激活部分专家省算力
上下文窗口Context Window一次能看多少词元
键值缓存KV Cache缓存历史结果加速生成

4. 大模型与生成式人工智能层

4.1 模型层级与训练阶段术语

大语言模型(Large Language Model, LLM)指参数量大、在海量文本上训练的语言模型。基础模型(Foundation Model)是更宽的叫法,泛指能迁移到多种下游任务的大规模预训练模型,不限于语言。训练阶段分两大段:预训练(Pre-training)在海量无标注数据上做自监督学习,目的是获得通用表示能力;后训练(Post-training)在预训练之后做定向调整,包括监督微调(Supervised Fine-Tuning, SFT)、指令微调(Instruction Tuning)和对齐(Alignment)。

对齐这个词容易被误解成"让模型听话",其实它的目标是让模型的行为与人类价值观和意图一致,涵盖有用性、诚实性和无害性几个维度。对齐做过头会出现对齐税(Alignment Tax),也就是模型变得过度保守,该答的也不答了。灾难性遗忘(Catastrophic Forgetting)是微调后模型丢掉了预训练阶段学到的通用能力,这是持续学习里的经典难题。

微调手段上,全参数微调成本高,所以有了参数高效微调(Parameter-Efficient Fine-Tuning, PEFT),代表方法是低秩适配(Low-Rank Adaptation, LoRA),思路是冻结原权重,只训练一对低秩矩阵,用极少的参数达到接近全量微调的效果。推理部署阶段还有量化(Quantization)、剪枝(Pruning)、知识蒸馏三件套来压缩模型体积。

4.2 提示、生成控制与检索增强术语

提示词(Prompt)是给模型的输入指令,提示工程(Prompt Engineering)是设计这些输入的方法论,系统提示(System Prompt)是设定角色和边界的顶层指令。思维链(Chain of Thought, CoT)是让模型把推理步骤写出来再给答案,对数学和逻辑题效果明显。

生成控制参数必须认识三个。温度(Temperature)控制随机性,接近 0 时输出最确定,调高会更发散;Top-k 采样只在概率最高的 k 个候选里挑;Top-p 采样,也叫核采样(Nucleus Sampling),按累积概率截断候选集合。贪心解码(Greedy Decoding)每步都选概率最高的词,束搜索(Beam Search)同时保留多条候选路径,适合翻译这类需要整体最优的任务。

生成式系统最该警惕的词是幻觉(Hallucination),指模型编造出看起来合理但实际错误的内容。对应的缓解思路叫接地(Grounding),让输出锚定在可验证的来源上。检索增强生成(Retrieval-Augmented Generation, RAG)是当前最常用的接地方案,流程是先把文档切成分块(Chunking),编码后存进向量数据库(Vector Database),检索时做语义搜索(Semantic Search),召回结果再经过重排序(Re-ranking)后塞进提示。

再往上一层是智能体(Agent),指能自主规划、调用工具调用(Tool Use / Function Calling)、并根据反馈调整的模型系统。多智能体协作叫多智能体(Multi-Agent),其中承担规划职责的模块常叫规划器(Planner),保存历史信息的模块叫记忆(Memory)。

中文英文我的理解
大语言模型Large Language Model, LLM参数大、文本量大训出来的模型
基础模型Foundation Model能迁移到多任务的大模型
预训练Pre-training海量无标注数据自监督学习
监督微调Supervised Fine-Tuning, SFT用标注数据做定向调整
对齐Alignment让行为符合人类意图
低秩适配Low-Rank Adaptation, LoRA冻结原权重只训小矩阵
量化Quantization降低数值精度省显存
温度Temperature控制输出随机性
核采样Nucleus Sampling, Top-p按累积概率截断候选
思维链Chain of Thought, CoT先写推理再给答案
幻觉Hallucination编造看似合理的内容
检索增强生成Retrieval-Augmented Generation, RAG先检索再生成,抑制幻觉
智能体Agent能规划、调工具、自我调整的系统

5. 评估、偏见与常见误用术语

5.1 评估指标术语

准确率(Accuracy)是最直观的指标,但在类别不平衡时极具欺骗性——负样本占 99% 的数据集,全猜负类也能有 0.99。所以要看精确率(Precision),即预测为正的样本里真正为正的比例;召回率(Recall),即真正的正样本被找出来的比例;以及两者的调和平均F1 分数(F1 Score)。混淆矩阵(Confusion Matrix)把四类结果排列出来,是排查问题最直接的工具。ROC 曲线和AUC衡量排序能力,与阈值无关。

生成任务里常用困惑度(Perplexity, PPL)衡量语言模型对文本的"意外程度",越低说明预测越准。翻译和摘要用BLEU和ROUGE衡量与参考文本的重合度,注意它们只看字面重合,不理解语义。检测和分割任务看交并比(Intersection over Union, IoU)和平均精度均值(mean Average Precision, mAP)。基准测试(Benchmark)是统一评测集合,基线(Baseline)是对比参照,消融实验(Ablation Study)是逐个去掉模块看影响,交叉验证(Cross-Validation)是轮换验证集以减少划分偶然性。

5.2 偏见、安全与鲁棒性术语

偏见(Bias)在人工智能语境里有两种含义,一种是统计意义上的偏差,另一种是模型输出对特定群体不公平,公平性(Fairness)就是衡量和缓解后者的研究方向。偏见的来源通常是训练数据本身,模型只是把数据里的倾向放大了。鲁棒性(Robustness)指模型面对扰动、噪声、分布外输入时保持稳定的能力,对抗样本(Adversarial Example)是专门构造出来骗过模型的输入。

可解释性(Explainability)和可解释性(Interpretability)常被混用,前者偏重事后给出解释,后者偏重模型本身结构上就能被理解。安全侧还有红队测试(Red Teaming),即主动扮演攻击方找漏洞,以及越狱(Jailbreak),指绕过模型安全限制的提示手法。

中文英文我的理解
准确率Accuracy最直观但在不平衡时骗人
精确率Precision预测为正里有多少真为正
召回率Recall真正的正样本找出来多少
F1 分数F1 Score精确率和召回率的调和平均
混淆矩阵Confusion Matrix四类结果排开看
困惑度Perplexity, PPL语言模型的意外程度
交并比Intersection over Union, IoU检测框重叠程度
消融实验Ablation Study逐个去掉模块看影响
偏见Bias数据倾向被模型放大
鲁棒性Robustness面对扰动保持稳定
对抗样本Adversarial Example专门构造来骗模型的输入
红队测试Red Teaming主动扮攻击方找漏洞

5.3 术语误用速查

有几个词我几乎每次交流都能听到被用错,列出来对照一下。第一组是参数和超参数,前者训练学,后者人手定,写实验记录时千万别混。第二组是验证集和测试集,前者可以反复用来调,后者只能用一次,反复用测试集调参等于自己骗自己。第三组是Epoch和Iteration,一个轮次包含多个迭代,汇报训练进度时说错会被直接看出底子。

第四组是微调和提示工程,前者改参数,后者不改,成本差好几个量级。第五组是准确率和精度,中文里"精度"有时指 precision,有时泛指 accuracy,讨论时最好直接说英文或写清楚定义。第六组是训练和推理,一个在学习,一个在使用,很多资源估算的错误都出在把两者混着算。

提示:跟别人讨论指标时,养成先说数据集分布、再说指标名称的习惯。脱离分布谈准确率,基本没有意义。

6. 工程落地、职业与学习路径词汇

6.1 部署与推理优化术语

推理(Inference)是模型跑起来给结果的过程,和训练相对。衡量推理的两个核心指标是延迟(Latency)和吞吐量(Throughput),前者看单次响应多快,后者看单位时间能处理多少请求,两者经常互相牵制。浮点运算次数(FLOPs)用来估算计算量。硬件侧常见图形处理器(GPU)、张量处理器(TPU)、神经网络处理器(NPU),以及 NVIDIA 的并行计算平台CUDA。

模型交换格式有开放神经网络交换格式(Open Neural Network Exchange, ONNX),推理加速有TensorRT,高吞吐服务有vLLM。批推理(Batch Inference)把多个请求合并处理以提高吞吐,代价是单请求延迟上升。模型服务(Model Serving)是把模型包装成接口的工程环节,机器学习运维(MLOps)是覆盖训练、部署、监控、回滚的全流程实践。联邦学习(Federated Learning)让数据留在本地,只上传模型更新;差分隐私(Differential Privacy)通过在统计结果里加噪声保护个体信息。

6.2 边缘计算与具身智能相关术语

边缘计算(Edge Computing)是把计算放到靠近数据源的一侧,边缘人工智能(Edge AI)就是在这类设备上跑模型。它的核心矛盾是算力、功耗、内存三者都紧,所以必须配合模型压缩(Model Compression),包括量化、剪枝和蒸馏。微型机器学习(TinyML)指在单片机和超低功耗设备上跑的模型。开发板里Jetson Nano是入门常见选择,配套的部署流程基本是导出 ONNX、再转 TensorRT 引擎、最后做量化校准。

具身智能方向还要认几个词:机器人学(Robotics)是学科总称,同步定位与建图(Simultaneous Localization and Mapping, SLAM)解决"我在哪、周围什么样",操作(Manipulation)指抓取和操控物体,仿真到现实迁移(Sim-to-Real)指在仿真里训练、迁移到真机上,数字孪生(Digital Twin)是物理实体的虚拟映射,用来做低成本试错。

6.3 职业、认证与学习路径术语

岗位名称先对齐。人工智能训练师对应AI Trainer,工作内容偏数据标注策略、评测设计和模型行为调优,现在已有分级认证体系,三级通常要求能独立设计标注规范和评测方案。数据标注员(Data Annotator)偏执行层。算法工程师(Algorithm Engineer)偏模型设计和实验。机器学习工程师(Machine Learning Engineer)偏工程化落地。提示工程师(Prompt Engineer)专注输入设计。生成式人工智能应用工程师侧重把生成式能力接进具体业务系统。人工智能产品经理(AI Product Manager)负责需求定义和效果验收。人工智能伦理(AI Ethics)是研究与应用中的规范方向。

学习路径上,我建议按人工智能基础到人工智能导论到专项深入的顺序走,不要一上来就啃大模型论文。人工智能基础概念和人工智能基础知识这两块打牢,后面看任何方向都会快。如果是为了做人工智能毕业设计或人工智能大作业,优先选有公开数据集、有可比基线、评测指标明确的任务,比如经典的猫狗识别这类图像分类,虽然简单,但全流程跑通一遍的价值远大于追热点。

认证方面,华为人工智能初识微认证这类入门级认证适合建立框架,高级别的生成式应用工程师认证更适合已经上手做过项目的人。

中文英文我的理解
推理Inference模型跑起来出结果
延迟Latency单次响应耗时
吞吐量Throughput单位时间处理请求数
浮点运算次数FLOPs估算计算量
边缘人工智能Edge AI在靠近数据源的设备上跑模型
模型压缩Model Compression量化剪枝蒸馏三件套
微型机器学习TinyML超低功耗设备上的模型
同步定位与建图SLAM我在哪、周围什么样
仿真到现实迁移Sim-to-Real仿真训练、真机部署
数字孪生Digital Twin物理实体的虚拟映射
人工智能训练师AI Trainer标注策略、评测设计、行为调优
算法工程师Algorithm Engineer模型设计与实验

7. 术语记忆与查阅的实操方法

7.1 三层记忆法

背术语最忌讳平铺直叙地刷表,刷完一遍什么也留不下。我自己的做法是分三层。第一层是场景层:每个术语必须挂在一个具体场景上,比如"数据泄漏"挂在我曾经把测试集混进训练集导致指标虚高 0.15 的那次事故上。有场景的词,回忆时是顺着故事出来的,比孤立记忆牢固得多。

第二层是对照层:把容易混的成对术语写成两列表格,逼自己写清楚差别。比如参数对超参数、验证集对测试集、微调对提示工程、精确率对召回率。这个动作看起来笨,但它把"我大概知道"变成了"我能说清",而后者才是能在面试和写作里用得上的。

第三层是输出层:用自己的话给一个完全不懂的人解释这个术语,不许用行话。如果你讲"自监督学习"时只能说"就是自己监督自己",说明还没真懂。讲成"把句子里的词遮住让模型猜,答案从原文里来,不用人标",才算过了这关。

7.2 高频踩坑与排查

第一类坑是中英文不对应。有些词中文有多个译法,比如 Grounding 有人译"接地",有人译"事实锚定",有人干脆不译。遇到这种情况,我的做法是记住英文原词,中文只当辅助,搜索文献时一律用英文。这样能避开大量同名不同义的混乱。

第二类坑是缩写撞车。AI 既是 Artificial Intelligence,在某些语境下也指 Adobe Illustrator;ML 既是 Machine Learning,也出现在其他领域;Transformer 既是模型架构,也是别的技术名。查资料时把领域词一起带上,比如"Transformer 注意力机制",命中率会高很多。

第三类坑是版本漂移。同一个术语在不同阶段的含义会变。比如"对齐"在早期指格式对齐,现在主要指价值对齐;"智能体"在符号主义时代指规则驱动的软件实体,现在指大模型驱动的自主系统。读老文献时要注意这一点,别拿今天的定义去套十年前的论文。

第四类坑是术语堆砌造成的虚假理解。有些人能连续说出"多模态、具身、世界模型、端到端"一串词,但问其中任何一个的具体输入输出是什么就答不上来。判断自己是否真懂一个术语,用一句话测试:它的输入是什么、输出是什么、解决什么问题、代价是什么。四个问题答不上两个,就是还没懂。

注意:术语表是地图不是领土。看懂地图不等于走过路,最终还是要落到一个能跑起来的项目上。

我在实际整理和使用这份表的过程中,最大的体会是:术语的价值不在于它听起来专业,而在于它能压缩沟通成本。同一个概念,你用一句话说清,别人省下十分钟理解时间,长期累积下来就是效率差距。另外提一句小技巧,我会在术语表里给每个词标一个"首次遇到时间",半年后回看,哪些词反复出现在不同项目里,哪些词只出现过一次,这个分布本身就能告诉你自己的知识结构偏在哪、缺在哪。这份表你不需要一次背完,把它当成工具箱,用到哪一层翻哪一层,用着用着就长在脑子里了。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询