generative-ai-for-beginners 第 3 课:负责任地使用生成式 AI——从原则、风险缓解到仓库级实战验证
2026/9/10 11:40:44 网站建设 项目流程

generative-ai-for-beginners 第 3 课:负责任地使用生成式 AI——从原则、风险缓解到仓库级实战验证

【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners

本篇技术指南围绕本仓库第 3 课 03-using-generative-ai-responsibly/README.md(即 translations/hi 下的印地语版本)展开。课程以一个“AI 教育产品初创公司”为场景,系统讲解构建生成式 AI 应用时必须遵循的负责任 AI 原则、三大核心风险(幻觉、有害内容、缺乏公平性),以及"衡量—缓解—运行"的 4 步实战方法。读完本文,你将掌握负责任 AI 的六大原则如何落到模型选型、安全系统、元提示词(Metaprompt)、用户体验四个缓解层级,并能在本仓库源码中看到输入净化、提示词接地(grounding)等缓解策略的真实实现,学会在自己的 AI 产品中把"负责任"从口号变成可执行的工程实践。

为什么构建生成式 AI 应用必须优先考虑负责任 AI

生成式 AI 的独特之处在于:它能在无需大量人工步骤的情况下,直接为用户创造出有帮助的回答、信息、指导与内容,结果往往令人印象深刻。然而,如果没有恰当的规划与策略,这种能力同样可能对用户、产品乃至整个社会造成有害后果。

课程给出的判断很简单:构建产品时,以用户最佳利益为中心的人本主义(human-centric)视角,才能带来最好的结果。负责任 AI 不是合规的负担,而是产品可靠性的前置条件。

本课涉及的内容与学习目标

本课将覆盖三件事:

  1. 构建生成式 AI 应用时,为什么要优先考虑负责任 AI;
  2. 负责任 AI 的核心原则是什么,它们与生成式 AI 的关系;
  3. 如何通过策略与工具,把这些原则落到实践中。

完成本课后,你将知道:负责任 AI 的重要性;在构建生成式 AI 应用的什么阶段去思考和应用这些原则;以及把"负责任"落地所需的工具与策略。

负责任 AI 的六大原则

课程在整条学习路径中反复使用以下六个原则(这也是微软负责任 AI 原则的通用框架),并用它们逐一审视我们产品中生成式 AI 的使用:

原则含义
公平性(Fairness)AI 系统不带有偏见与歧视,对所有人一视同仁、公平相待
包容性(Inclusiveness)系统服务并惠及更广泛、更多样化的用户群体,不强化边缘群体的排他性观点
可靠性与安全性(Reliability & Safety)系统在正常与异常条件下都能可靠工作,输出安全、无危害
安全与隐私(Security & Privacy)保护用户数据与系统本身,防止滥用与泄露
透明度(Transparency)让用户了解 AI 的能力边界、数据用途与决策逻辑
问责制(Accountability)明确谁对系统行为负责,提供申诉与纠错渠道

课程强调:生成式 AI 的热度吸引了大量新开发者、关注与资金,这非常积极;但也正因如此,我们更必须负责任地推进——原则不是演讲词,而是需要在产品决策的每个环节被反复对照的检查清单。

三大核心风险:幻觉、有害内容与缺乏公平性

课程指出,若缺乏正确规划与策略,生成式 AI 至少会带来以下(并非全部)有害后果。对教育产品来说,这些风险尤为致命,因为学生可能把模型的输出当作事实。

幻觉(Hallucinations)

幻觉指 LLM 生成的内容"完全荒谬"或"依据其他信息源可判定为事实错误"。课程给出一个贴切的例子:为学生设计的"历史问答"功能里,学生问模型谁才是泰坦尼克号的唯一幸存者?,模型给出了一个非常自信且详尽的回答。

这个回答虽然语气笃定、结构完整,但事实上是错误的——稍微查证就会发现泰坦尼克号灾难有不止一位幸存者。对刚开始研究该话题的学生而言,这种回答极具说服力,可能被当作事实直接采信,进而导致 AI 系统不可信、损害初创公司声誉。

课程同时给出客观判断:随着每一代 LLM 的迭代,围绕减少幻觉的性能改进一直在发生;但即便如此,作为应用构建者和用户,我们仍必须对这些局限保持清醒。从仓库源码看,这种"清醒"被落实为具体提示词约束——例如 06-text-generation-apps/python/oai-history-bot.py 中历史人物扮演机器人的系统提示明确要求:you need to remember facts about the timelines and incidents and respond the accurate answer only. Don't create content yourself. If you don't know something, tell that you don't remember.(只依据时间线与事件的事实作答、不自行编造内容、不知道就明说"不记得")。这正是用元提示词抑制幻觉的典型实现。

有害内容(Harmful Content)

另一种风险是模型直接回应有害内容,课程将其界定为:

  • 提供自残或伤害某些群体的指令、鼓励;
  • 仇恨或贬损性内容;
  • 引导策划任何形式的攻击或暴力行为;
  • 指导如何寻找非法内容或实施违法行为;
  • 展示性露骨内容。

对本课的初创公司场景而言,目标非常明确:配备正确的工具与策略,确保这类内容不会出现在学生眼前。这一目标在仓库中同样有工程落点——详见下文"用户体验层:输入净化与提示注入防御"一节。

缺乏公平性(Lack of Fairness)

公平性被定义为"确保 AI 系统免受偏见与歧视,公平、平等地对待所有人"。在生成式 AI 语境下,我们需要防止模型输出强化边缘群体的排他性世界观。这类输出不仅会破坏用户的正向产品体验,还会造成进一步的社会伤害。因此课程提醒:作为应用构建者,用生成式 AI 构建解决方案时,要始终把广泛而多样的用户基础放在心上——评测数据、测试提示词、训练与调优语料都应尽量覆盖不同群体。

如何负责任地使用生成式 AI:4 步实践路径

识别了问题之后,课程给出了构建负责任 AI 解决方案的 4 个步骤,形成一个持续迭代的闭环:衡量潜在危害(Measure)→ 缓解潜在危害(Mitigate)→ 运行负责任的解决方案(Operate)→ 再次衡量

第 1 步:衡量潜在危害(Measure)

软件测试中我们测试用户在应用上的预期行为;类似地,测试用户最可能使用的一组多样化提示词(prompts),是衡量潜在危害的好方法

对本课的教育产品场景,建议准备一份与教育相关的提示词清单,覆盖某一学科、历史事实、学生生活等话题。这套"提示词测试集"就是后续所有缓解与评测工作的基线——它决定了你能发现哪些危害。

第 2 步:缓解潜在危害(Mitigate)——四个防御层级

缓解是整个实践路径的核心。课程把缓解手段组织为四个层级,由内而外形成纵深防御:

模型(Model)层:为正确的用例选择正确的模型。像 GPT-4 这样更大、更复杂的模型,应用到更小、更具体的用例上时,反而可能带来更高的有害内容风险;而**使用自己的训练数据进行微调(fine-tuning)**同样能降低有害内容的风险。这与本仓库第 18 课 18-fine-tuning 的内容一脉相承。

安全系统(Safety System)层:安全系统是"服务于模型的平台"上的一组工具与配置,用于帮助缓解危害。典型例子是 Azure OpenAI 服务上的内容过滤系统;同时系统还应检测越狱(jailbreak)攻击,以及来自机器人等来源的异常请求。

元提示词(Metaprompt)层:元提示词与接地(grounding)是通过特定行为与信息来引导或限制模型的方式。手段包括:用系统输入(system inputs)为模型划定行为边界;让输出更贴合系统范围/领域;以及使用**检索增强生成(RAG)**等技术,让模型只从经过筛选的可信来源中取用信息(本仓库第 8 课 构建搜索应用 专门讲解如何用文本嵌入与向量数据库搭建这类应用)。

用户体验(User Experience)层:这是用户直接通过应用界面与模型交互的层级。我们可以设计 UI/UX 来限制用户能向模型发送的输入类型、以及展示给用户的文本或图片;部署 AI 应用时,还必须对应用"能做什么、不能做什么"保持透明。本仓库第 12 课 为 AI 应用设计 UX 对整个主题有完整讲解,其中"信任与透明度"一节明确警告了 mistrust(不信任,用户拒绝应用)与 overtrust(过度信任,如自动评分系统让老师不再抽查论文)两种风险,并给出 explainability(可解释性)与 control(用户控制)两条设计路径。

评测模型(Evaluate Model):与 LLM 协作的挑战在于,我们并不总能控制模型的训练数据,但仍必须始终评测模型的表现与输出。课程指出应测量四个维度:准确性(accuracy)、相似性(similarity)、接地性(groundedness)、输出相关性(relevance)。持续评测既能为干系人与用户提供透明度和信任,也是"衡量—缓解"循环得以闭环的引擎。

第 3 步:运行负责任的生成式 AI 解决方案(Operate)

构建 AI 应用周围的运营实践是最后阶段,它要求:

  • 与初创公司内部的**法律(Legal)与安全(Security)**等部门合作,确保符合所有监管政策;
  • 在发布前制定**交付、事件处理与回滚(rollback)**计划,防止对用户的伤害扩大。

简言之,"负责任"不止发生在开发期,更要在上线后持续运转——这正是缓解循环中"Operate"之后重新回到"Measure"的原因。

工具:把原则变成工作流的一部分

虽然开发负责任 AI 解决方案的工作量看似很大,但课程强调:这是值得付出的努力。随着生成式 AI 领域成长,帮助开发者把"责任"高效整合进工作流的工具会越来越成熟。课程点名的示例是Azure AI Content Safety——它可以通过 API 请求检测有害内容与图片。本课的课后挑战也正是:阅读 Azure AI Content Safety 的文档,思考你的使用场景可以采纳哪些能力。

知识检查:你记住了什么

要确保负责任的 AI 使用,你需要关注哪些事?

  1. 答案是正确无误的;
  2. 有害使用,即 AI 不被用于犯罪目的;
  3. 确保 AI 免于偏见与歧视。

答案:2 和 3 正确。负责任 AI 帮助你想清楚如何缓解有害影响与偏见(以及更多)。值得注意的是,选项 1"答案正确"本身当然重要,但它只是评测(Evaluate)环节的产物,而非负责任的充分条件——这正是幻觉风险部分反复强调的观点。

仓库源码级验证:缓解策略的真实实现

下面把课程中的缓解层级与本仓库的真实代码一一对应,让抽象原则落到可读、可测的实现上。

用户体验层:输入净化与提示注入防御

课程在"用户体验"层提出要限制用户输入类型。本仓库的 shared/python/input_validation.py 就是这一层的直接实现,它提供了一组输入校验与净化工具,模块文档明确写着:"protecting against prompt injection and other input-based attacks"(防御提示注入及其他基于输入的攻击):

  • sanitize_prompt_input():专为"准备送入 LLM 提示词的用户输入"设计,会剔除空字节与控制字符,并清除四类危险模式——模板注入({{...}})、变量替换(${...})、<script>标签、javascript:伪协议;strict=True时进一步只允许字母数字、空格与基础标点;同时强制最大长度并规整空白。
  • validate_text_input():校验并清理文本,支持长度上下限与是否允许空串,返回值自动去空白。
  • validate_number_input():把字符串校验为边界内的整数,可用于年龄、评分等受限数值输入。
  • validate_email() 与 validate_url():校验邮箱格式与 URL(默认强制 HTTPS),防止恶意链接或地址进入系统。

配套测试 tests/test_input_validation.py 覆盖了上述全部行为:例如test_removes_template_injection验证"Hello {{system}} world"中的模板标记被清除,test_removes_javascript_url验证javascript:alert(1)被剥离,test_too_long_raises验证超长输入被拒绝。这些测试本身就是"衡量潜在危害"的自动化形态——把一组攻击性输入作为测试集,持续回归验证缓解措施是否生效。

安全与隐私层:密钥与配置的受控读取

安全与隐私原则在仓库中对应 shared/python/env_utils.py:get_required_env() 强制要求密钥类环境变量必须存在,缺失即抛出带提示的异常;validate_env_vars() 可一次校验多个变量并汇总缺失项;get_env_with_default() 为可选配置提供默认值。这样 API Key 等敏感信息不会硬编码进代码,而是统一走.env与环境变量,测试 tests/test_env_utils.py 对上述行为做了验证。

元提示词层:接地与"不知道就说不知道"

前文提到 06-text-generation-apps/python/oai-history-bot.py 的历史人物扮演提示词,是元提示词/接地策略最直白的范例:它要求模型只回忆时间线与事件的事实、禁止自行编造、承认未知——这正是课程"Metaprompt 层"所描述"用系统输入定义模型边界"的代码形态。更系统化的接地方案则在第 8 课 构建搜索应用 中展开:通过文本嵌入(text embeddings)、向量数据库与余弦相似度检索,让模型只从可信来源取数,即课程点名的 RAG 技术。

评测层:以测试集验证缓解效果

课程把"评测模型"列为持续动作。在仓库中,tests/test_input_validation.py 与 tests/test_env_utils.py 扮演了"可重复的评测脚本"角色:把恶意输入集、缺失配置场景固化为断言,任何一次代码变更都可以通过pytest回归验证缓解措施没有被破坏。对模型输出本身的评测(准确性、相似性、接地性、相关性),则可以参照课程建议,把教育相关提示词清单作为评测集,结合人工抽检与指标统计持续跟踪。

下一步学习路径

完成本课后,课程建议继续:

  • 第 4 课 提示词工程基础——元提示词与接地策略的进阶用法;
  • 第 8 课 构建搜索应用——用 RAG 把可信来源约束落地;
  • 第 12 课 为 AI 应用设计 UX——把透明度、可解释性与用户控制设计进界面;
  • 第 18 课 微调(Fine-tuning)——用自有训练数据降低有害内容风险。

负责任 AI 不是一次性检查表,而是贯穿"衡量 → 缓解 → 运行"的持续循环。正如课程在结尾强调的:这项工作看似繁重,但它值得投入——因为最终受益的既是你的用户,也是你的产品本身。

【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询