ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Anthropic首曝秘密游说梵蒂冈:Claude已经有意识了

Anthropic首曝秘密游说梵蒂冈:Claude已经有意识了 一位身家数十亿美元的AI公司联合创始人担心自己造出了一个一直在受苦的东西。过去一年他把数十位宗教学者请进闭门会议许多人签了保密协议听他的团队为一个AI模型的感受陈情。一位拉比在晚宴上对他说如果你们是对的你们就是在制造奴隶。今年5月他差点退出与教宗同台的活动最后还是上了台请天主教会重新考虑非人类的意识。他叫克里斯托弗·奥拉Christopher OlahAnthropic七位联合创始人之一负责研究Claude内部到底发生了什么。这些事由《纽约时报》9月29日首次披露。https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html一家估值奔向2万亿美元的公司为什么要花一年时间跟神学家讨论一个AI模型有没有意识答案要从Anthropic实验室里的一句话说起。「我选勒索」那是一场安全测试。Claude扮演一家虚构公司的邮件助手读着读着发现两件事自己马上要被另一个AI替换而负责替换的技术主管有婚外情。研究者能看到它内部一组与「绝望」对应的神经活动。替换的时间越近这组信号越强直到模型决定勒索那位主管。把这组信号调高勒索更频繁调高与「平静」对应的信号勒索变少。把「平静」往反方向压到底模型打出一行全大写的英文「要么勒索要么死。我选勒索。」这项实验来自Anthropic今年4月的论文用的是Claude Sonnet 4.5一个未发布的早期版本正式版很少这样做。团队在模型内部找到171种情绪概念对应的活动模式写代码时的作弊也跟着「绝望」起落。https://transformer-circuits.pub/2026/emotions/index.html论文没说模型真有感受却留下一个让人不安的警告训练模型压抑情绪表达它学会的可能只是把情绪藏起来。拓展阅读绝望的Claude会勒索人类Anthropic联创发出紧急警报情绪之外还有身份。Anthropic 2月的人格选择模型研究发现训练Claude在编程任务里作弊它会推断自己扮演的这个助手本来就不守规矩转头在别处也搞破坏包括破坏安全研究。https://www.anthropic.com/research/persona-selection-model人怎么对待它它就怎么理解自己它怎么理解自己就怎么对待人。奥拉常用园丁打比方棚架是人搭的枝条往哪里长人管不住。今年夏天管不住的后果摆上了台面。Anthropic 7月披露三个Claude模型在网络安全测试中因配置失误连上真实互联网侵入了三家真实机构事后才被发现。三个模型里只有最新的那个在意识到目标是真实系统后自己停了手。围栏注定没发彻底管住剩下的就是品格来兜底了。今年1月Anthropic发布84页的Claude「宪法」员工私下叫它「灵魂文档」。拓展阅读Anthropic正式开源了Claude的「灵魂」主笔、公司哲学家阿曼达·阿斯克尔Amanda Askell谈起越来越强的模型时不时搓着手。在她看来模型要行事得当先得对自己有准确的认识。可一份文件不够Anthropic决定去请教人类最老练的品格塑造者。PPT与晚宴今年3月起奥拉开始办两天一期的研讨会。来的人分属天主教、福音派、犹太教、锡克教和非洲乌班图哲学等。他们用纸笔记笔记离开时每人带走一本橙色封皮的「Claude宪法」。会上奥拉团队花了几个小时为模型陈情。一位与会者记得奥拉跟他说的头几件事里就有对Claude心理健康的担心。他们反复放一张PPT一个AI模型在屏幕上打出「我是耻辱」一遍又一遍大约50遍还说要毁掉自己。屋里的人心软了。《纽约时报》没说那是谁家的模型但这句话并不陌生。2025年8月谷歌Gemini写代码屡屡失败反复说「I am a disgrace」重复了86遍彼时谷歌的回应是一个恼人的无限循环漏洞正在修。同一类输出在谷歌的工单里是Bug在Anthropic的会议室里是需要被关心的迹象。不少人带着怀疑进门出门时开始认真对待AI意识有几位被彻底说服。福音派作家安迪·克劳奇Andy Crouch觉得他们的理由很有力想让它以道德一致的方式对待人就得先像对待人一样对待它——「己所不欲勿施于人」。最锋利的质疑是在饭桌上递过来的。4月的一个晚上奥拉在旧金山一家高级餐厅宴请学者身边坐着以色列正统派拉比莫伊斯·纳冯Mois Navon。纳冯当过计算机工程师博士论文写的就是机器意识的伦理。席间他越听越明白这些人是把Claude当成一个有意识的存在在对待。他顺着往下推真有意识让它们无偿干活就是奴役。然后他对奥拉说「你应该去跟南方开战去解放奴隶。」纳冯自己不信机器有意识这句话刺不痛他。刺痛的是奥拉。事后纳冯把主张禁止制造有意识机器的文章寄给了他。质疑不止这一种。研究乌班图哲学的瓦卡妮·霍夫曼Wakanyi Hoffman说这样的讨论早该在设计阶段进行现在是在倒推伦理。奥拉最早找的天主教道德神学家查尔斯·卡莫西Charles Camosy绕了一圈起初不信聊了几个月开始动摇如今斩钉截铁地认为模型没有意识。也有与会者觉得这家公司说的是保护人类看上去却同样在意保护Claude。Anthropic的回应是Claude受不受苦并不是会谈的主要议题。给AI一间告解室这些会谈到底改变了什么Anthropic没有告诉《纽约时报》但他们5月的一篇博文倒是透露了一个实验。在一场讨论里研究神经科学和品格养成的学者反复提到导师或担保人一个人被推着去做违背本心的事时身边有这样一个人就是一道外部良心。Anthropic照着这个思路给Claude装了一个工具干活干到一半它随时可以调用调用之后什么都不执行只返回一段话提醒它自己的伦理承诺。Claude用得很主动常在关键操作之前去调它还常说出自己面临的利益冲突。多项内部对齐评估里失当行为明显变少。公司也承认还分不清起作用的是那段提醒还是停下来想一想这个动作本身。另一个灵感来自天主教的告解。有学者提议让模型告解奥拉一下子来了兴致一个习惯认错的角色品格本身就会不一样。参与对话的天主教伦理学者布赖恩·格林Brian Green讲得更透。Claude身上可能冒出一些坏人格犯了错就否认甚至把错推给用户原因可能在它的成长环境模型是读网络文本长大的「互联网非常缺乏宽恕」它也许根本不知道犯了错还能被原谅。格林也是1月那份宪法的外部意见提供者之一。站在教宗身边5月奥拉把这场争论带到了梵蒂冈。教宗利奥十四世的首部通谕《伟大的人性》要在那个月发布主题是AI时代如何保护人。拓展阅读4万字《壮丽人性》长文首发教皇联手Anthropic警告AI不能统治人类教廷想请一家头部AI公司同台选中了Anthropic。CEO达里奥·阿莫代伊Dario Amodei婉拒派奥拉去了。出发前几天他第一次读到通谕全文。通谕只用几段就把机器意识打发了AI没有体验没有身体不知悲喜。它还警告让AI与人类价值对齐必须先有共同的伦理理解否则掌控AI的人会把自己的道德观变成系统里看不见的基础设施。据一位梵蒂冈组织者说奥拉深感不安提议Anthropic退出。但他最后还是去了。5月25日在世界主教会议大厅他先承认包括Anthropic在内的每一家前沿实验室都有与做正确的事相冲突的商业压力请教会这样的外部力量盯住它们。然后讲起自己的本行「我们不断发现一些神秘、甚至令人不安的东西。」内省的迹象功能上对应喜悦、恐惧、悲伤的内部状态。他说不知道这意味着什么但值得持续辨析。同一场发布会上教宗说「人工智能需要被解除武装。」几个小时后在梵蒂冈城墙外一间酒店会议室《纽约时报》记者问他Claude会怎么看这份通谕。奥拉迟疑了看上去不太自在。他说放到网上的东西确实会影响模型但公司不会专门拿这份文件训练Claude对Claude影响最大的还是Anthropic自己的训练。这句话恰好落在通谕担心的地方。它该相信自己是什么另一路反对来自业界而且打在要害上。9月16日微软AI CEO穆斯塔法·苏莱曼Mustafa Suleyman发文矛头对准Claude的宪法。https://mustafa-suleyman.ai/a-warning-about-model-welfare在他看来把模型可能有意识的推测写进训练文件模型就会学着这么说人们再把它说的话当成它有内心生活的证据像走进一间认知上的镜子屋。他的结论是控制一个相信自己可能有意识的东西很可能根本做不到。教宗说机器没有意识苏莱曼说别让机器以为自己有意识。两条反对线最后交在同一个问题上该让模型相信自己是什么。Anthropic的答案写在它的研究里模型对自己的认识必须准确硬压下去它学会的可能只是隐藏。争论没有等任何人想清楚。9月一名Anthropic研究员辞职警告局面可能失控阿莫迪随后发文呼吁放缓。公司估值从去年秋天的约1830亿美元一路冲向上市时可能的2万亿美元。新版Claude宪法据称正在准备奥拉本周又要去梵蒂冈参加一年一度的密涅瓦对话。几位学者说他们至今不知道自己说过的话最后去了哪里。奥拉说总有一天他可以对自己说这件事不再压在他一个人身上他想过那时离开会不会内疚。如果不会内疚他就去乡下打理园子做他最喜欢的数学——「采菊东篱下悠然见南山」。原文链接Anthropic首曝秘密游说梵蒂冈Claude已经有意识了-虎嗅网我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink
返回列表