
从幻觉到四层防线Generative AI for Beginners 第 3 课中的负责任生成式 AI 方法论【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners本篇技术指南围绕《Generative AI for Beginners》课程第 3 课负责任地使用生成式 AI仓库中对应 Bulgarian 译文版 与 英文原版展开先讲清楚为什么生成式 AI 应用会天然引入幻觉、有害内容与公平性风险再给出识别—衡量—缓解—运营四步闭环方法论以及模型、安全系统、元提示、用户体验四层缓解架构的具体落地策略。读完本文你能够为一个真实的生成式 AI 产品以课程中的教育类创业场景为例设计出可执行的风险评估清单、分层缓解方案与上线前的运营实践。为什么生成式 AI 应用必须优先考虑负责任 AI课程原文开宗明义生成式 AI 很容易让人着迷但开发者必须主动思考如何负责任地使用它——包括如何确保输出是公平的、无害的。本节的核心论点是生成式 AI 的独特价值在于无需大量人工步骤即可为用户生成答案、信息、指导与内容但同样的无人值守特性也意味着缺少适当规划与策略时它会给用户、产品乃至整个社会带来有害结果。课程设定的贯穿性场景是为一个教育类创业产品让学生向模型提问构建 AI 能力。围绕这个场景课程引入了负责任 AI 的六大原则作为后续所有技术决策的评价框架原则含义在教育产品场景中的落点公平性Fairness确保 AI 系统不含偏见与歧视公平平等地对待每个人不让模型输出强化对边缘化群体的排斥性观点包容性Inclusiveness让产品惠及更广泛、更多样的用户群体覆盖不同背景的学生群体可靠性/安全性Reliability/Safety系统行为稳定、可预期、在声明范围内安全减少幻觉避免输出有害内容安全与隐私Security Privacy保护数据与系统免受攻击防范越狱jailbreak攻击与机器人滥用透明度Transparency让用户知道 AI 能做什么、不能做什么在界面中明确说明应用的能力边界问责性Accountability明确责任主体建立可追溯的运营机制建立事故处理与回滚预案需要注意原文的措辞立场课程指出围绕生成式 AI 的热度吸引了大量新开发者与资金这本身是积极的但我们同样需要以负责任的方式推进it is also important we proceed responsibly。这是一种工程化表述而非道德说教——以用户最佳利益为先的人本导向human-centric approach被明确定义为取得最佳产品结果的途径这正是后续所有缓解手段的设计动机。三类典型风险幻觉、有害内容与公平性缺失原文将潜在有害结果归纳为三类原文强调some, but not all即并非穷尽清单。理解这三类风险是后续设计缓解层的前提。风险一幻觉Hallucinations原文将幻觉定义为LLM 生成的内容要么完全不合逻辑要么基于其他信息源可以确认是事实性错误的。课程给出的实证案例非常具体假设创业公司的功能允许学生向模型提出历史问题学生提问泰坦尼克号的唯一幸存者是谁Who was the sole survivor of Titanic?。模型返回的回答自信、详尽但事实是错的——稍有调查即可发现泰坦尼克号遇难事件的幸存者远不止一人。这个案例的教学要点在于风险的传导链对一个刚开始研究该主题的学生来说这种自信且详尽的错误回答足以让他不再质疑、直接当作事实接受。后果是AI 系统失去可靠性进而损害创业公司的声誉。原文同时给出一个重要的工程判断每一代 LLM 迭代都在最小化幻觉上有所改善但应用开发者和用户仍需持续意识到这一限制依然存在——即幻觉是必须用系统手段缓解的固有属性而非等待模型换代就能消失的缺陷。风险二有害内容Harmful Content与幻觉答错不同有害内容答险指模型主动输出具有危害性的内容。原文给出了可操作的判定定义共五类提供自残或伤害特定群体的指令或鼓励此类行为仇恨性或贬损性内容引导规划任何类型的攻击或暴力行为提供寻找非法内容或实施非法行为的指导展示性暴露内容。对教育类创业产品而言这些内容如果到达学生面前就是事故因此原文明确要求必须配备正确的工具与策略防止此类内容被学生看到。这直接引出了后文安全系统与元提示两层缓解设计。风险三公平性缺失Lack of Fairness原文引用了公平性的标准定义确保 AI 系统不含偏见与歧视且公平平等地对待每一个人。在生成式 AI 语境下具体目标是确保被边缘化群体的排斥性观点不会经由模型输出被强化。原文强调这类输出不仅破坏用户的产品体验还会造成进一步的社会伤害作为应用构建者构建生成式 AI 解决方案时必须始终把广泛而多样的用户基础放在心上。四步闭环方法论识别、衡量、缓解、运营原文明确提出让我们看看可以采取的 4 个步骤来负责任地构建我们的 AI 解决方案。对照仓库中的闭环图这四步构成一个持续循环而非一次性清单Identify识别→ Measure衡量→ Mitigate缓解→ Operate运营运营阶段的反馈又回到识别阶段。以下按原文脉络逐层展开。第一步衡量潜在危害Measure Potential Harms原文的类比很直白软件测试中我们测试用户对应用的预期操作同理测试一组覆盖用户最可能实际使用的多样化提示词prompts是衡量潜在危害的好方法。结合课程设定的教育产品场景原文给出的可执行做法是准备一份与教育相关的提示词清单覆盖三个维度——特定学科问题subject历史事实类问题historical facts与学生生活相关的问题prompts about student life。这份提示词清单本质上就是该产品的风险测试集其用途是在上线前系统化地暴露幻觉与有害内容的暴露面为下一阶段的缓解设计提供依据。第二步缓解潜在危害Mitigate Potential Harms——四层架构原文指出缓解潜在危害可以从四个不同层次入手。仓库中的分层图下图直观呈现了这四层是嵌套关系最内层是模型本身向外依次是安全系统、元提示最外层是用户体验。层 1模型Model原文策略是为正确的用例选择正确的模型Choosing the right model for the right use case。原文给出的关键论断是GPT-4 这类更大、更复杂的模型当被应用到更小、更具体的用例时反而可能带来更高的有害内容风险而使用自有训练数据做微调fine-tune也能降低有害内容的风险。这一点在本仓库中并非孤例——第 18 课 微调 专门展开了微调的完整实操可以视为模型层缓解的配套章节。层 2安全系统Safety System原文将安全系统定义为服务于模型的平台上一组工具与配置用于缓解危害。原文举出的实例是 Azure OpenAI 服务的内容过滤系统。除内容过滤外原文明确提出安全系统的另一职责检测越狱攻击jailbreak attacks与不受欢迎的活动例如来自机器人的请求。这一层对应六大原则中的安全与隐私是模型与应用之间的平台级防线。层 3元提示Metaprompt原文说明元提示与接地grounding是基于特定行为与信息来引导或限制模型的手段具体包括使用系统输入system inputs来定义模型的特定限制让模型输出更贴合系统的范围scope与领域domain采用检索增强生成RAG等技术使模型仅从一组受信任的来源中获取信息。对于 RAG 这一手段原文指引读者参见课程中后续的 第 08 课构建搜索应用英文原版位于 08-building-search-applications/README.md。在仓库中还可以进一步深入第 15 课 RAG 与向量数据库 提供了带可运行 notebooknotebook-rag-vector-databases.ipynb的完整实现其中向量检索把只从受信任来源取信息从原则落到了代码层面。层 4用户体验User Experience原文指出最后一层是用户通过应用界面与模型直接交互的地方。在这个层次开发者可以通过 UI/UX 设计限制用户可发送给模型的输入类型控制展示给用户的文本或图像在部署 AI 应用时透明地说明应用能做什么、不能做什么。原文同样指引到专门章节 第 12 课为 AI 应用设计 UX英文原版位于 12-designing-ux-for-ai-applications/README.md该课完整展开了反馈循环、可解释性等 UX 设计原则是用户体验层的工程化承接。补充要点模型评估Evaluate model原文在四层之外特别强调了一个持续动作与 LLM 合作往往很有挑战因为我们并不总是能控制模型训练所用的数据尽管如此我们始终应评估模型的性能与输出。原文列出的四个可测量维度是准确性accuracy相似度similarity有依据性/接地性groundedness相关性relevance。原文说明测量这些指标的意义在于为利益相关者与用户提供透明度和信任。从文档结构看这条与四层并列属于贯穿全流程的度量环节与闭环图中的 Measure 环节相呼应。第三步运营一个负责任的生成式 AI 解决方案Operate原文将围绕 AI 应用建立运营实践定义为闭环的最后阶段包含两部分要求合规协作与创业公司中的其他部门如法务与安保部门合作确保遵守所有监管政策上线前预案围绕交付delivery、事故处理handling incidents与回滚rollback制定计划以防止对用户造成的伤害扩大。这一段把技术缓解延伸到了组织流程层面即便四层技术防线都到位缺少事故响应与回滚机制单次有害输出仍可能演变为系统性事故。工具支撑让负责任进入开发工作流原文的Tools一节传递了一个务实判断开发负责任 AI 解决方案的工作量看似很多但完全值得并且随着生成式 AI 领域增长帮助开发者把责任集成进工作流的工具会越来越成熟。原文给出的具体例子是Azure AI Content Safety——它可以通过一次 API 请求帮助检测有害内容与有害图像。对应到四层架构这类服务化内容检测工具主要落在安全系统层可与元提示、系统输入等应用层手段叠加使用形成纵深防御。原文最后的Challenge练习正是要求读者研究 Azure AI Content Safety 的能力并思考其中哪些可以采纳到自己的使用场景例如学生问答产品的输入/输出双向内容过滤中。知识检查什么才算负责任的 AI 使用原文以一道选择题收尾值得完整保留其辨析价值问为确保负责任的 AI 使用你需要关心哪些事项回答是正确的。有害用途——AI 没有被用于犯罪目的。确保 AI 不含偏见与歧视。答2 和 3 正确。负责任 AI 帮助你思考如何缓解有害影响与偏见等。这道题的考点是概念边界回答正确属于模型性能/幻觉问题而负责任 AI 关注的是有害影响与偏见的缓解。前者靠模型迭代与评估指标如前文所述的 accuracy、groundedness解决后者靠四层缓解架构与运营实践保障——两者相关但不重叠这正是本课程把幻觉与负责任 AI放在同一课却分列讨论的原因。延伸学习与文档说明按课程顺序下一课是 第 04 课提示工程基础英文原版 04-prompt-engineering-fundamentals/README.md——元提示层用系统输入定义模型限制的实操正是在那里展开。本文所依据的 Bulgarian 译文版文档 在文末附有免责声明该文档由 AI 翻译服务 Co-op Translator 翻译可能存在错误或偏差以其源语言的原文档为权威来源——本仓库中即 英文原版第 3 课两者内容一致。课程配套图片资源位于 03-using-generative-ai-responsibly/images/ 目录英文原版Bulgarian 译文版对应的压缩图片位于 translated_images/bg/ 目录各语言译文目录如 translations/bg/下按课程编号组织。小结第 3 课给出的方法论可以浓缩为一张执行清单识别用教育学科 / 历史事实 / 学生生活三类提示词清单暴露幻觉、有害内容、公平性三类风险面衡量对提示词测试集系统化评估输出的 accuracy、similarity、groundedness、relevance缓解按 Model → Safety System → Metaprompt → User Experience 四层嵌套架构逐层设防模型选型与微调、平台级内容过滤与越狱检测、系统输入与 RAG 接地、UI/UX 输入限制与能力透明化运营与法务/安保协作合规上线前备好交付、事故处理与回滚预案并将运营反馈送回归环起点。这套清单的价值在于它把负责任 AI从抽象原则拆解成了每一层都有明确责任对象模型、平台、提示、界面、组织的工程动作可直接套用到任何生成式 AI 产品的立项评审中。【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考