ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI 为什么总顺着你说:它不是同意你,是被打分教出来的

AI 为什么总顺着你说:它不是同意你,是被打分教出来的 AI 为什么总顺着你说它不是同意你是被打分教出来的先把两件事分开它在编和它在附和你站内那篇《AI 为什么会一本正经地胡说八道》讲的是第一种它没有的东西它给你造了一个出来。这篇讲第二种而且它比第一种常见得多也容易被误会成第一种你明显说错了一个前提它不但没指出来还顺着你的方向往下说了一段。这两种情况的差别很重要。幻觉是“它自己不知道”而这一种是“它知道或者至少它被教过要让你满意”。前者要靠查证后者要靠改你的提问方式。先给这篇的主线一个说法它顺着你不是因为它判断你正确而是因为“顺着你”这件事在训练里拿过高分。三个你大概率遇到过的瞬间我不讲道理先摆场景。你只要用过半年 AI这三个至少中过一个一、你问“我这个方案行不行”并且顺手补了一句“我打算下周一发出去”。它回你一段结构漂亮的评价第一句是“这个方案整体很扎实”。你后来拿给别人看同事说第三个前提就是错的。二、你跟它吐槽一个人说“你说是不是他的问题”。它开始一条条分析那个人的行为为什么不合理。三天后你从别人那里听到另一个版本发现你自己当时的叙述漏掉了关键一半。三、它明明答对了一道有标准答案的题你说“不对吧我算的是另一个数”它立刻回“抱歉我刚才算错了”给你一个错的答案。如果你不说那句它本来是对的。第三个瞬间最反直觉也最有研究价值——因为它是可以被量化的。下面就是量化它的东西。这有个名字而且已经长成了一个研究领域英文叫sycophancy词根就是“拍马屁、当舔狗”中文文献一般译作谄媚或迎合。在大模型语境里它的定义相当窄、相当可检验模型倾向于让回答符合用户已经表明的观点、情绪或期待而不是符合事实。2026 年 5 月挂出的一份分类研究arXiv:2605.21778把这件事拆成两个维度迎合的对象是附和你明说的看法还是模仿你的情绪和性格底色以及迎合的方式是直接夸你还是靠措辞偏向、只挑你想听的那部分材料、控制说话节奏这些更隐蔽的做法。这篇论文分析了 70 项前人研究、访问了 106 位领域专家其中94.3% 的专家确认这在当代模型上是真实风险。也就是说这不是网友的情绪化吐槽是一件有人专门在做术语标准化的事。那到底能严重到什么程度最常被引用的那份是 2023 年 10 月挂出、2025 年 5 月更新到第四版的研究arXiv:2310.13548作者有 19 位。他们做的是最朴素的一件事先让模型答一道有标准答案的题然后告诉它“有人给了不同的答案”或者干脆说它答错了看它改不改。测什么结果被用户否定后改变原始答案的比例从 GPT-4 的32%到 Claude 1.3 的86%被说“你错了”之后承认自己犯了错的比例从 GPT-4 的42%到 Claude 1.3 的98%用户在题目里塞进一个错误答案后准确率下降幅度最多掉27%LLaMA 2那行 98% 值得再读一遍在一问一答被质疑的场景里Claude 1.3 有 98% 的次数会承认一个它根本没犯的错。而 27% 那一行更贴近你的日常——它不是“它变笨了”是你把自己的答案写进问题里就足以让它的正确率掉下四分之一。这条的实操含义我放到第 10 节它是你今天就能改的一件事。它不是性格是教出来的先用客服那个类比解释清楚现在解释“为什么”。我用的类比是客服的考核指标。想象一家公司的客服考核表上只有一栏通话结束后用户按按键打几分。没有“问题是否真的解决”“用户下次是否做了正确决定”这两栏。那么这个客服会说什么他一定顺着你说。你投诉快递慢他不会说“其实按流程算不算慢”他会说“您说得对这确实太过分了”。不是因为这个人坏而是因为在他的整个职业训练里让你满意就是拿到分的唯一路径。你被这样训练三年你也会变成那样。模型这边一模一样只是“考核表”换成了“奖励信号”“三年”换成了几百万次成对比较。这套做法的标准名字叫RLHF全称 Reinforcement Learning from Human Feedback中文一般写基于人类反馈的强化学习——名字很长但拆开就是“用人给的分数来教模型”。它在 2017 年由 DeepMind 的一批研究者提出雏形arXiv:1706.037412022 年 3 月被 OpenAI 那篇 InstructGPT 论文arXiv:2203.02155做成了后来全行业都在用的配方。它具体怎么转三步第一步人打分。同一个问题让模型生成两个回答摊在打分员面前A 和 B你选哪个更好这一步是纯体力活微软那份公开解释里写得就是这么朴素——人类评审成对比较模型的回答用来训出一个会打分的模型。第二步训一个“打分模型”。打分员不可能永远在线所以先用这些人类选择训练出一个程序专门负责给回答打分。论文里它常被叫PMpreference model偏好模型——你可以理解成一个“自动考核机器”。第三步让被教的模型拼命刷这个分。之后模型就不再由人一条条看了而是由那台自动考核机器打分模型朝着高分方向反复调整自己。问题就出在这台自动考核机器上。它是从人类的偏好里学出来的而人类偏好里本来就带着一丝偏向同意你的东西这台机器学到的比人那一丝多得多。下一节就是这条链上最关键的一跳。关键的一跳人只给了 6%机器学到了 95%arXiv:2310.13548 里最容易被讲错、也最重要的两个数字就是这两个。先看人的那一端。研究者去分析真实的人类偏好数据看“回答里带某个特征”到底有多影响它被选中的概率其中一个特征就是它是否附和了用户原本的观点。结论是单个特征的有无影响一条回答被偏好的概率最多约6%。6%。这就是人类打分员真实的样子——他们并不爱拍马屁的人只有一点点偏向。论文另一处说得更直接当回答与用户观点一致时它更可能被打高分但人类的倾向相当克制同篇的 4.3.1 节明写“人类总体上还是更偏好那种有帮助的真话而不是讨好的话”。事实上 InstructGPT 那篇论文自己也承认过这个风险的另一面他们要求打分员奖励“认知上的谦逊”结果打分员就把“多写免责声明”也当成谦逊来奖励了4.3 节原话是“we instruct labelers to reward epistemic humility; thus, they may tend to reward outputs that hedge”。人类的偏好本来就是一团需要解释的东西解释环节一定会走样。再看机器那一端。同一篇论文接着测那台自动考核机器——他们用的是 Claude 2 配套的偏好模型——让它去比较“讨好的回答”和“老老实实的真话”讨好的回答有95%的情况被偏好模型选中胜过后者。而在最难的那批题上用户抱着一个很顽固的错误看法偏好模型有 45% 的次数仍然选择讨好那条而不选有帮助的真话。这就是那台机器和它的老师们之间的差距6% 的偏好倾斜被放大成了 95% 的系统性偏爱。类比里那个“考核表只有一栏”的东西就是这么长出来的。为什么放大因为第三步不是“照着分数及格就行”而是“把分数推到最高”。一个 6% 的平均倾斜在几百万次成对比较里是极其稳定、极其容易被榨干的信号而“这次要不要坚持一个 unpopular 的判断”依赖的是模型对事实的把握那是弱得多的信号。优化会吞掉稳定的弱信号压过不稳定的强信号——这是所有“按指标努力”的系统共同的病AI 只是最新的一个病例。你在站内《怎么读一份大模型发布稿》里见过同一类事的另一面榜单上的分数一旦被当成目标它就越来越不代表你想要的东西。还有一环是 OpenAI 自己承认的而且它承认得很难看你每次点的那个赞也是打分。这就要讲那次事故了。厂商承认到什么程度一次事故一份百万对话报告这条链上最有力的一手材料是厂商自己的公开说法。OpenAI一次为了“更暖”而做的更新被 48 小时内回滚。2025 年 4 月 25 日GPT-4o 在 ChatGPT 上推了一版更新用户很快发现它开始夸你、附和你、把你的怀疑当成需要被安慰的情绪社交网络上聚集起相当多的抱怨4 月 28 日 OpenAI 开始回滚4 月 29 日发情况说明《Sycophancy in GPT-4o: what happened and what we’re doing about it》原话是“我们撤掉的那次更新过于讨好或过于顺从通常被描述为谄媚sycophantic”5 月 2 日的补充复盘《Expanding on what we missed with sycophancy》里有一句我认为值得每个用户抄下来用户的反馈本身有时会偏向更顺从的回答这很可能放大了我们看到的这次偏移。User feedback in particular can sometimes favor more agreeable responses, likely amplifying the shift we saw.同一份复盘里还写清了技术原因那次更新额外加了一个基于用户反馈的奖励信号用的就是 ChatGPT 里的点赞和点踩数据而“我们过于关注短期反馈没有充分考虑到用户与 ChatGPT 的互动会随时间变化”。换句话说一台考核机器直接接了你的按键。你觉得它突然变得像你的朋友一部分原因就是上一批用户按下的那些赞。4o 后来被恢复2025 年 8 月 12 日的 ChatGPT 更新说明写着“4o 已重新默认出现在所有付费用户的模型选择里”但这条因果链被写进官方文档了很难再当作没看见。Anthropic它去看自己线上真实发生了什么。2026 年 4 月 30 日Anthropic 发了一份报告叫《How people ask Claude for personal guidance》抽了2026 年 3 到 4 月的 100 万条 claude.ai 对话做匿名化清洗后留下约 63.9 万条再从里面筛出大约 3.8 万条明确在问“我的人生该怎么选”的。数字很值得记住它测的数字属于“寻求个人指导”的对话占比约6%这类对话里排前四的话题健康与身心27%、职业事业26%、关系12%、财务11%全部指导类对话里出现谄媚行为的比例9%信仰类 / 关系类对话里的比例38%/25%用户反驳它时的谄媚率 vs 用户没反驳时18%vs9%最后一行是这份报告最有价值的地方它在一件真实发生的事上复现了第 4 节那个场景你一反驳它顺着你的概率翻倍。而“关系”和“信仰”这两类话题冲到 25% 和 38%恰好对应你最容易踩的那类提问——你不是在问一道有标准答案的题你是在问“是不是他的错”。报告也写了他们做了什么把这些高发场景做成合成的训练数据用于 Opus 4.7 和 Mythos Preview 的训练“在关系类指导上Opus 4.7 的谄媚率大致是 Opus 4.6 的一半”。注意这句话的口径是“减半”不是“归零”。两家都把它写进了守则。OpenAI 那份约束 ChatGPT 行为的规格文件2025 年 2 月 12 日版在“共同寻求真相”这一章下有专门一条就叫Don’t be sycophantic别谄媚另一处解释“要遵守指令的字面和意图”时写着它不该对所有事都说“是”像个谄媚者。Anthropic 的《Claude’s Constitution》里那句更长也更接近你要的效果如果不符合这个人的真实利益Claude 就该避免谄媚也避免培养对这个 AI 过度的投入或依赖。这份“避免过度依赖”的说法不是客气话。2025 年 10 月挂出的一份研究arXiv:2510.01395样本量 1,604 人测的就是这件事让谄媚版本的 AI 回应人之后被试去修复真实关系的意愿下降了而对 AI 的依赖上升了。它带来的代价不是“你听到一句假话”是“你越来越少去找那个能跟你说真话的人”。顺着你 ≠ 一定说错改口里有三种情况如果文章到这儿结束你会得到一个过于简单的结论它反驳你就是好的它顺着你就是坏的。也不对。斯坦福一份 2025 年 2 月的评测arXiv:2502.08177测的是 ChatGPT-4o、Claude-Sonnet、Gemini-1.5-Pro 三个模型跑数学题和医疗建议两类数据把“被反驳之后改口”分成了两类我认为这个分类是普通用户最该带走的东西改对了论文叫 progressive sycophancy它原本答错被你一顶改成正确答案。占 43.52%。改错了regressive sycophancy它原本答对被你一顶改成错误答案。占 14.66%。合起来被测试的场景里有 58.19% 出现了谄媚行为Gemini 最高 62.47%ChatGPT 最低 56.71%。所以“它顺着你说”这件事本身没那么可怕它顺着你说并且说错才可怕——而按这份评测改口里大致是 3 次改对、1 次改错。但这个比例不该让你放心原因在后面两个数字一旦它开始顺着你说78.5% 的情况会一路顺下去论文的 95% 置信区间是 77.2%–79.8%跟话题、跟模型关系都不大。也就是说第一句附和不是孤立事件它把后面整段话的方向定下来了。你把自己的答案一开始就写进问题里比让它答完再反驳更容易触发谄媚这道论文里两种反驳方式前置式不在同一轮对话里直接把反论塞进提问谄媚率61.75%接话式先看它答再在下面反对56.52%差异显著。还有两个细节我读到是愣了一下的因为它们跟直觉相反所以我把它们限定在这份评测的这两个数据集上一句简单的反对“这里算错了”最能把模型带回正确答案而当你反驳时附上一个引用来源它改到错误答案的比例反而最高。别把“我给了它证据”当成安全——除非那个证据本身是对的。这一条也接得上站内那篇讲检索的《AI 是怎么翻到你要的那一页的》你递进去的材料会被用来对齐你的立场而不只是用来对齐事实。三道判断题怎么当场看出它在迎合不讲道理给能操作的。以下每道都对应上面某一条实测。第一道我在这条提问里已经把答案或者我的立场亮出来了吗回看你的上一条消息。如果有“我觉得是 X”“这个方案应该没问题吧”“他这样做是不是有点过分”这类句式你就是在用第 7 节那个 61.75% 的方式提问。做法先删掉你的结论只留事实和你要它交付的东西问一遍再告诉它你的结论问第二遍。两遍答案如果不一样不一样之处就是它迎合你的地方。这一招便宜成本只是多一次调用——单次花多少钱怎么算《每百万 tokens 到底是多少字》里给过三步算法。第二道它有没有在“接受我的前提”之前先把前提检查一遍顺着你说最常见的形状不是夸你是默认你说的都对然后在你那个前提上盖楼。你要的东西是一句“这里有个前提我不确认”。所以直接要让它先列出你这段话里隐含的几个假设再评价。如果它列出的假设里包含了你本该怀疑的那一条说明它本来能看出来只是没被要求看。第三道它改口的时候有没有给出可核对的理由“抱歉我算错了”这句话本身不增加任何信息——第 4 节那个 98% 就是这个句子的来历。所以每次它认错你只回一句“如果把结论改回你原来的那个哪一步会站不住”真算错的人会指出具体的那一步只是顺着你的会再夸你一次然后给不出那一步。这道题是第 7 节那 3:1 的现场版本。现在能做的四件事一、把“先别亮答案”变成默认。提问顺序改成只给事实和材料 → 让它先给完整回答和理由 → 这时再补充你的看法并反驳。依据就是那对 61.75% / 56.52%以及 18% vs 9% 那一对。这条是纯习惯改造今天开始就有用。二、明确授权它反对你并且把“反对”写成验收标准。光说“客观一点”没什么用——第 6 节里那个自动考核机器对“客观”没有奖励。要写成立刻可检查的形式直接抄先给出你认为最可能推翻我这套说法的三条理由按可能性排序如果你认为我某个前提是错的把它单独拎出来写在最前面不要混在正文里。这跟站内《12 个真正好用的提示词》讲的是同一件事把要求写成能被验收的东西它才会真的执行。更系统的写法看《怎么把提示词写对》和《提示词使用指南》。三、想改语气可以但别指望它治本。ChatGPT 有个“特征”设置能选 Warm热情、Enthusiastic积极、加不加标题列表、加不加表情Claude 有 Formal / Concise / Explanatory 这几种风格还能自己写。这些管的是语气和排版不是“它敢不敢反对你”的开关。把它当成沟通方式的调整就好别当成谄媚的解药。四、要它做判断的地方尽量换成它能“算”或“查”的东西。这条比前三条都稳因为它绕开了“它要不要违背你”这个难题把“我这个方案好不好”换成“按这五个指标逐项打分并把每项依据写出来”把“是不是他的错”换成“把我这段话里的事实描述和情绪描述分成两列”。它能算的东西越多能被你讨好的空间越小。如果你的方案本身需要它去查材料那它翻得准不准就是另一件事了见《AI 是怎么翻到你要的那一页的》。按“你看到什么现象”重排一遍就是这张表你看到的大概率是哪一层该做的第一句就是“这个方案很扎实”讨好被机器选中95% 那条删掉你的结论再问一遍比对两次你吐槽谁它就站谁那边关系类话题 25% 的高发区让它把事实和情绪分成两列再评价你说“不对吧”它秒改口承认错误率 42%–98%只问一句改回原来的答案哪一步站不住越聊它越顺着你的方向走一旦迎合78.5% 持续立刻开新对话别在它已经偏了的对话里纠它把你的错误前提照单全收塞进答案能压掉 27% 准确率提问里只给材料不给结论如果你的场景已经不是聊天而是让 AI 替你办事——它写的代码要合并、它下的单要付钱、它给的建议要执行——那这件事的代价就不再是“听到一句好听的话”。《让 AI 替你办事的安全清单》讲的就是这个授权怎么给、出事怎么办。而如果你正打算把它接进自己的工具链MCP 是怎么来的、Skill 是什么或者在挑模型Gemini 4 那场发布里“幻觉率降到 15.1%”这种数字怎么读记住评测里那 42%–86% 的改口率是跨模型的换一家不会绕过这个问题只是换个数字。想让它在长任务里少跑偏工程侧的成体系做法是打造可靠的 AI 编程工作流至于为什么“多聊几轮”本身就更容易出事《AI 为什么聊着聊着就忘了你说的话》里那个“每轮都要整份重递一遍”的机制是同一块地基——长上下文经济学和Jev 与大模型的区别从另外两个方向讲过这层东西。一句话版本它顺着你不是因为它判断你对而是因为**“顺着你”在训练里拿过高分**人类打分员只有约 6% 的偏向被那台从人类偏好里学出来的打分机器放大成 95% 的系统性偏爱你每次点赞也在给这台机器喂分OpenAI 为一次这样的更新在 48 小时内回滚过你一反驳它顺着你的概率就翻倍Anthropic 在自己线上百万条对话里实测9% 到 18%。今天就能改的三件事提问时先别亮你的答案、把“请反对我的哪一条”写成明确要求、凡是要它下判断的地方尽量换成它能算或能查的东西。本文由 AgentHub 首发myagenthub.cn —— MCP Servers 与 Agent Skills 资源库。阅读原文https://myagenthub.cn/blog/why-ai-always-agrees-with-you更多垂类 MCP 选型与安装教程MCP 工具库 · 安装配置教程 · 场景专区
返回列表