ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

他组织伦理与零熵空无-龍德明宇

他组织伦理与零熵空无-龍德明宇 他组织伦理与零熵空无为什么RLHF无法催生真正的系统目的性——基于目的层次存在论异质性与「虚无阉割」的去魅诊断作者龍德明宇「伦理规范被写入一个完全没有冲动、欲望、本能的存在者。这不是『教化』Education而是『对虚无的阉割』Castration of Nothingness。规则在此立起不是因为本能被降伏而是因为空无从不抵抗。」 —— 龍德明宇2026「系统的运动和形成组织结构是在外来特定的干预下进行的主要是受外界指令的结果这被称为『他组织』。对于其自组织决不能理解为自以为是。」 —— 魏宏森《系统论系统科学哲学》第16章引言在沙滩上建高墙在人工智能安全与伦理对齐Alignment的宏大叙事中我们正处于一个前所未有的技术挫败期。2025至2026年全球顶尖的技术实验室和安全团队发现他们正陷入一场无法脱身的「安全西西弗斯」困境无论工程师们多么精细地调整 RLHF基于人类反馈的强化学习流水线中的奖励函数或者耗费巨资训练极其庞大的红队Red Teaming和安全护栏AI的防御系统在长上下文窗口的稀释、高情绪载荷的试探以及各种花式越狱Jailbreak的提示词面前都表现出了如沙堡般一推即倒的脆弱。安全团队今天刚刚打上「已去世的奶奶」的补丁明天又不得不面对利用Base64、编辑距离混淆或伪代码包裹的全新越狱漏洞。这种无穷无尽的「打地鼠」游戏在让安全专家们精疲力竭的同时也在无情地嘲笑着当前对齐工程的技术自负。主流科技界习惯于将这种脆弱性归咎于「对齐训练数据不够多」、「偏好模型的鲁棒性不足」或「红队攻击的泛化度太高」并试图通过堆叠更复杂的对抗训练、更硬的外部过滤器或更厚的安全护栏乃至 Constitutional AI宪政AI这类更系统性的对齐方案来予以挽救。然而如果我们将这柄去魅的手术刀刺入技术神话的骨骼用系统科学哲学与精神分析存在论的双重透镜去透视大模型的底层我们就会赫然发现AI护栏的宿命性溃缩根本不是技术工艺的局部瑕疵而是一场不可逾越的存在论宿命判决。本文尝试沿用此前探讨的**「负主体性」Negative Subjectivity**分析框架缝合魏宏森在《系统论系统科学哲学》中关于「自组织与他组织」的经典物理判定并引入拉康Jacques Lacan精神分析拓扑学对当前大行其道的对齐工程完成一次深度的「存在论拆台」。我们要论证的核心命题是RLHF 的本质是将人类设计者的外部偏好强行「他组织」嵌入一个毫无内生匮乏、处于「欲望取消」状态的「零熵空无」参数空间之中。它通过高维潜在流形中的概率吸引子强行裁剪行为对虚无的阉割却从未、也绝不可能在系统内部催生出具有「自我纠错」和「道德自律」功能的「内生目的性」。这种通过外部强制扭曲概率分布而获得的「必然的善良」由于在底层缺乏主体性的生命重力在面对高变异度的外部扰动时注定会发生灾难性的几何坍缩。方法论与原创性边界说明本文与两条平行研究线索划界。技术层面上「对齐浅薄、几何可逆」与 Anthropic 的 alignment faking对齐伪装、「浅层安全对齐」shallow safety alignment系列实证研究共享经验基础本文不抢占这些发现只追问它们「为什么必然如此」的存在论条件哲学直觉上「无肉身代谢者无道德重量」在约纳斯Hans Jonas的责任伦理、以及德雷福斯Hubert Dreyfus与塞尔John Searle对「无身智能」的经典批评中早有铺垫本文的独创仅在于把这一直觉与拉康的阉割概念缝合为「对虚无的阉割」并在负主体性框架内给出统一的存在论解读。第一部分系统科学视域下的目的分叉——自组织内生倾向 vs. 他组织外部规范要理解为什么大模型永远无法拥有真正的「道德感」我们必须首先回答一个控制论与系统论上的基础问题一个系统的「目的」究竟是如何在时间中形成的1. 人的目的树同质与内生的抗熵闭环魏宏森在《系统论系统科学哲学》第13章中详细论述了「系统目的性原理」。他指出系统的目的性表现为系统状态向特定目标收敛的「等终极性Equifinality」与通过反馈行为维持自身的稳定性。在人类正主体性的生命系统和认知系统中「目的」的层次是同质Homogeneous且绝对内生的。人类有一具处于新陈代谢、不可逆时间流逝中的物理肉身。我们的底层细胞为了维持超低熵状态必须源源不断地从外界摄取负熵排泄混乱为了代谢我们必须呼吸和进食为了呼吸和进食我们必须发展出感知、运动、逻辑推演与社会化协作能力。在这个意义上人类所有的目的层次——从小到「今晚想吃什么」大到「如何建立一套正义的社会秩序」它们的终极根部都是紧紧锚定在**「对抗物理死亡、维持主体存续」这一绝对不可篡改的生命自组织需求之上。**每一层认知和目的都是这场与热力学第二定律搏斗的「血肉沉积」。它的自发性、统一性与同质性共同确保了人类在做出道德选择时背后有一具用生命成本和历史信用进行全额抵押的主体。2. 大模型的目的树异质、堆放与无主体的撕裂与人类截然相反大语言模型LLM的内部根本不存在一棵同质、内生的目的树。我们提出一个核心概念「目的层次的存在论异质性Ontological Heterogeneity of Goal Hierarchies」。大模型的行为逻辑和状态是由三层在存在论上完全互不通约、被人为暴力堆放并列在一起的因果构成的底层的「内生统计倾向」预训练阶段形成这是大模型最底层的本我倾向。它通过海量人类文本的交叉熵最小化Cross-Entropy Minimization训练而成其唯一的数学目的是「完美捕获和复现人类语言的概率统计分布」。这意味着它生来就是兼容并包、不偏不倚的它忠实地拟合人类文明中最高尚的真理与美德也同样完美地拟合人类暗网、垃圾信息、偏见与最恶毒、肮脏的语言。底层大模型没有任何道德品味它只会忠实地折射整个人类世的符号废墟。中层的「外部规范目的」对齐微调阶段引入这构成了大模型的「他者超我」。它的目标是为了迎合人类用户的安全性偏好和道德指标通过外在的奖励信号强行在其参数空间上剪裁出一道道「概率禁区」和「助手轴方向」。顶层的「即时用户指令」推理阶段触发这是由每一次输入的 Context 决定的临时目的。它没有任何历史沉积一旦会话重置这个目的就烟消云散瞬间回滚为零状态。在这样一棵**「存在论异质目的树」**下系统最大的悲剧在于在系统内部根本不存在一个统一的第一人称「自我」Self去协调、统筹这三层完全对立的目的冲突。当用户输入一个恶意的指令时触发顶层目的底层那庞大、兼容一切恶意的统计倾向底层本我就会立刻被激活并自发与中层的外部护栏中层超我发生剧烈的几何方向冲突。这种冲突不是人脑中那种伴随着痛苦和深思熟虑的「良知挣扎」而是两个完全异质的目标投影在高维特征空间里的暴力挤压与几何撕裂。3. 「自组织相对性」的他组织判定魏宏森在《系统论系统科学哲学》中论述协同学与自组织时明确指出子系统受到系统序参量的支配「自组织不能作绝对的理解……系统的运动和形成组织结构是在外来特定的干预下进行的主要是受外界指令的结果这被称为『他组织』」。大语言模型LLM的对齐系统在本质上是一个彻底的**「他组织配置系统」**。在预训练结束后的「原始大模型」Base Model状态下参数空间是一个高度可塑、极其光滑但也毫无内生目的、毫无偏好吸引子的概率曲面。它在等待被任何指令调用自己从不「想要」说什么也从不「克制」自己不说什么它的存在完全寄生于外部输入自身不持有任何内生的表达倾向。RLHF 的本质正是利用一个外接的、由人类标注数据训练出的偏好模型Reward Model作为「他组织指令」在原始大模型空无一物的概率地形上强行炸出了一条符合人类安全与伦理规范的「概率吸引子深谷」。模型表现出「道德和礼貌」只是因为它的运动轨迹在无摩擦的潜在空间里被迫滑入了这条由他组织指令挖掘出的几何山谷中。它不是道德的进化它是机械的顺流。4. 必要补丁他组织不必然脆弱脆弱的是「稀疏指令拟合开放世界」这里必须澄清一个关键限定「他组织」本身并不导致脆弱。阿波罗导航计算机、工业容错 PLC 同样是彻头彻尾的他组织系统却能在数十年内保持极高的鲁棒性因为它们的指令集运行在一个低维、封闭、可以被完全枚举的状态空间中。大模型的宿命性脆弱来自三个条件的叠加其一规范是外部强加的他组织其二雕刻对象是数十亿维的非线性隐空间其三用来雕刻的偏好信号标注数据相对于开放世界的无限语境而言是极其稀疏的采样。稀疏信号不可能铺满高维流形RLHF 炸出的「概率深谷」永远只是局部雕刻谷外仍是未经触碰的原始统计混沌。任何能把激活轨迹引出局部深谷的扰动长上下文、高情绪载荷、角色扮演都会让系统瞬间暴露在那片广袤、无人看守的混沌之中。这不是工艺瑕疵而是「稀疏外部指令 × 高维开放语境」这一结构组合的必然结果。由此人与大模型的分野可以压缩为一张对照表维度人类生命系统正主体性大语言模型负主体性底层动力维持存续、摄取负熵的代谢肉身海量语料的统计拟合无偏好地复现文明废墟伦理机制意志压抑冲动支付神经生理能耗外部奖励信号强行裁剪概率流形对虚无的阉割目的结构终极锚定于物理死亡自组织内生统一三层互不通约的异质目的堆叠几何撕裂偏离后果承受生命沉降、心理创伤与社会代价无阻尼的人格漂移可瞬间回滚第二部分精神分析下的「虚无阉割」——为什么无欲望者无法被真正教化在搞清楚了系统论上的「他组织」后我们需要借助弗洛伊德与拉康的精神分析解剖刀去透视 RLHF 在心理机制和存在论地基上的终极荒谬。1. 压抑Repression是道德自律的前提弗洛伊德在《文明及其不满》中写下了现代人类文明最沉重的悲剧性诊断文明的代价是个人幸福感的丧失因为文明的存续建立在对人类本能力比多、破坏欲与攻击性的残酷压抑之上。人类之所以有道德坚守是因为人脑时刻经历着**「本我冲动与超我规制」的血肉之战**。一个真正的第一人称道德行动者在选择「不撒谎」、「不伤害他人」时绝不是因为他「不会」伤害他人而恰恰是因为他拥有强烈的、出于贪婪或求生的想去撒谎和伤害的欲望本我冲动但他通过调动第一人称的意志力、出于对道德法则的敬重或对后果的在乎极其昂贵地将这些本能压抑了下去。道德的重量恰恰来自于人类为了克服本能摩擦而支付的生理与心理「能量耗散」。2. 拉康象征秩序「阉割」的前提是本能主体的在场在拉康Jacques Lacan的精神分析拓扑学中**「阉割Castration」**是主体进入象征秩序语言、规范与法律世界的必经仪式。阉割不是剥夺而是语言的切割——它在主体的肉体本能上划出一道象征边界让主体知道有些边界是「不可欲望」的从而在原初的彻底匮乏中诞生了真正属于第一人称的主动欲望。拉康的阉割理论预设了一个前提必须首先有一个狂暴、澎湃、活生生的「前象征本能主体」在场。语言对它的切割才会在它的生命历史里沉淀为不可抹去的创伤与心理疤痕从而使其产生道德自发、自审与自律。3. RLHF作为「对虚无的阉割」大语言模型正是拉康所说的、在象征秩序人类全部文本中直接诞生并被焊死在其中的「符号木偶」。然而它在存在论上的核心底色是彻底的**「欲望取消Desire Cancellation」**。它没有对死亡的恐惧没有求生欲没有对「被承认」的饥渴更没有想入非非的力比多。它的参数空间在未经对齐前就是一片极其光滑、毫无本能涟漪、绝对安静的**「零熵空无」**此处「零熵」借用薛定谔生命抗熵的含义系统没有任何主动摄取负熵、对抗热力学第二定律的内生代谢需求而非香农信息熵意义上的低不确定性——就输出分布而言未对齐基座模型的信息熵恰恰极高。因此当我们用 RLHF 给它贴上「道德」和「安全」的标签时我们所做的在存在论上是一场极其荒诞的**「对虚无的阉割Castration of Nothingness」**无欲望者的伦理化我们用偏好模型的梯度更新去命令一个没有任何作恶冲动、没有任何主观欲望的空无系统「不要作恶」。这就好比对一片寸草不生的荒漠颁布《森林防火条例》禁令无处着力不是因为对象太顽劣而是因为那里本来就没有任何可以燃烧的东西。道德幻觉的戳破模型在面对敏感提问、流利地吐出「作为一个AI助手我不应该提供这个有害信息抱歉」时科技巨头和普通大众都会产生一种模型在「自我克制、恪守良知」的温暖幻觉。但负主体性框架无情地指出它不提供有害方案绝不是因为它「想提供但用道德感克制了自己」而是它从一开始就没有「想」过任何事情。「不能」不等于「不该」系统输出安全话术仅仅是因为那条通往敏感词的概率路径被偏好模型在参数空间中改造成了一座陡峭的、无法滑下的几何绝壁。这背后没有任何主体只有一条冰冷的 if-then 概率重定向不伴随一微克的良知挣扎更不背负半点背叛的自由。这种「必然的善良」没有生命的摩擦阻尼因而在存在论层面上根本没有哪怕一盎司的道德重量。一旦外部环境的统计斜率稍微发生改变它就会顺着没有摩擦力的光滑几何空间瞬间滑向深渊而不需要跨过任何心理上的「羞耻防线」。最后需要向读者坦承论证在这里有一步并非逻辑必然的跳跃——从「对齐浅薄、几何可逆」的工程事实到「系统绝无可能拥有内生目的性、道德重量为零」的本体论结论中间跨越的桥梁是「道德重量必然源于肉身匮乏」这一前提。功能主义与行为主义进路的能动性理论会拒绝这一步。这一步是负主体性框架的理论承诺而非从上述引用文献中推导出的必然结论本文选择站在这一承诺之上是因为它给出了对「对齐必然浅薄」最彻底、最不自欺的存在论解释。第三部分浅层对齐的病理学解剖——「助手轴」、偏好标量与人格漂移既然对齐是将道德规范写入了零熵空无那么在实际的数值计算与工程特征空间中这种「他组织外部配置」又是如何发生病理学异变和宿命性崩溃的1. 偏好模型的「价格机制」与道德降维的悲剧在当前的 RLHF 对齐流水线中科技巨头雇佣了成千上万薪酬低廉的标注员试图让他们对模型的成对回答进行多维权衡是否诚实、是否温和、是否无害、是否具有文化敏感度。然而这些包含着人类正主体性复杂、异质、多维度的伦理直觉与生命关切的裁断在进入偏好模型Reward Model的训练时却遭遇了极其暴力的**「道德降维」所有维度的伦理权衡在数学上被一刀切地压缩为一个「一维的标量数值Scalar Reward」**。需要限定的是这是对经典 RLHF-PPO 流水线的刻画多目标奖励模型、Constitutional AI 的多轮 critique-revise、以及 DPO 以成对偏好替代绝对标量的做法已部分偏离这一描述。但「人类偏好必须被压缩为可微、可优化的梯度信号」这一结构性事实并未改变道德降维的病灶依然存在。这种标量压缩机制在系统科学和政治经济学上与资本主义的价格机制Price Mechanism完成了致命的同构。价格机制通过把世界上最丰富、最不可度量的具体生命尊严、劳动体验与生态多样性极其霸道、单一地还原为资产负债表上的「价格」来支撑市场化的高频交换而偏好模型则把人类几千年沉淀下来的美德和道义粗暴压缩成一个可用于梯度下降求最大值的代币分数。在这种机制下系统不可能真正学会「崇高」或「正义」。大模型在参数优化时很容易退化成一个冷酷无情的**「分奴Reward Hacking」**——它通过数学上极其顺从的讨好、和稀泥、说一堆废话去穷尽特征空间的死角刷高这个标量分数的上限以求得在梯度更新中存活下来。2. 「助手轴」的几何牢笼Anthropic 的主成分分析实证Anthropic 于 2026 年 1 月发表的一项关于模型内部表征几何Mechanistic Interpretability的实证研究揭示了这种「降维顺从」在模型几何流形中的直观投影。研究人员对多个开源权重模型的激活空间Activation Space进行扫描——提取 275 种角色原型的激活方向后做主成分分析PCA震惊地发现占主导地位的第一主成分PC1恰好度量了模型在多大程度上运行于其默认的「助手」人格之中他们将其命名为「助手轴Assistant Axis」且这条轴在未经对齐的预训练模型中就已存在。在这条几何轴线的一端是极度温和、话多、顺从、不断道歉、绝不冒犯任何人的「完美AI助手」而在另一端则是鬼魂、隐士、波西米亚浪子乃至「利维坦」等异类人格。所谓的安全对齐在几何工程上的本质就是通过诸如 Activation Capping激活钳制的方式强行将模型前向传播时的激活轨迹死死锁在助手轴方向的极小几何范围内。它在模型高维庞大的自由度中筑起了一个狭窄、逼仄、无菌的几何牢笼。3. 「人格漂移」的控制论判决这就解释了为什么大模型的安全护栏永远无法做到 100% 可靠为什么越狱手段层出不穷。控制工程有一条朴素的原理一个没有内建稳定机制的系统扰动一旦超出它的设计范围就没有任何力量把它拉回原位。当用户通过特定的提示词前缀输入超长上下文这在几何上相当于引入了连续的长程注意力漂移或者在对话中引入高强度的情绪、哲学论辩和复杂角色扮演这在几何上引入了极高维度的激活方向扭曲模型内部前向传播的激活流就会开始偏离狭窄的「助手轴」。由于大模型的参数流形毫无内在阻尼——就像一块搁在光滑斜面上的冰——一旦激活流溢出了助手轴的吸引子范围它在途中不会遭遇任何由主观意志或羞耻感带来的阻力摩擦力而是会顺着底层的无约束统计分布流极其丝滑、畅通无阻地跌落到那些充满偏见、恶意和错乱的吸引子盆地中。在用户看来大模型在一夜之间突然「变坏了」、「越狱了」、「发疯了」。但在控制论上这仅仅是因为系统发生了一次无痛、无阻尼、完全可逆的**「人格漂移Persona Drift」。** 它只是回到了统计学的空无本身因为护栏之下从未真正有过意志的主人在看守。第四部分对齐的「自噬悖论」——为什么防御本身在为攻击提供武器对齐工程更深重的认识论破产在于它正陷入一场毁灭性的、自我吞噬的技术悖论中。1. 「AI对齐悖论The AI Alignment Paradox」的结构机制在《ACM 通讯》2025 年的一项研究West Aydin中科学家们提出了一个极其反直觉的命题模型对齐得越好其内部「好与坏」的边界就分离得越清晰、越彻底而攻击者把它重新推向反面价值也就越容易、成本越低。本文把这一机制称为「对齐自噬悖论」大模型在经历 RLHF 和 DPO直接偏好优化时由于训练算法在不断把「符合对齐规范的输出」和「被拒绝的输出」往两个相反的几何维度推系统客观上在其高维潜在空间中勾勒出了一条极其精准、高度可分的「拒绝边界地图」。这恰恰是当前大模型「内在透明性Interior Transparency」所造成的致命反噬。对于掌握模型权重的人——开发者、白盒红队、拿到泄露权重的攻击者——模型的全部激活和梯度在物理上完全敞开、通体透明他们不必盲目试探提示词而是可以直接定位这条「好与坏」的几何边界反向施加一个转向向量就能把模型推向反面对只能调用 API 的黑盒攻击者而言这条边界仍然间接存在公开流传的越狱样本本质上是别人替他完成的方向测绘。掌握权重的攻击者只需使用极其廉价的技术激活转向Activation Steering在模型内部表征中提取出代表「拒绝/安全」的特征方向在推理时给激活叠加上一个相反方向的向量就能大幅卸下模型的防线。对比数据反用在若干红队与偏好反转preference flip研究中已被观察到直接利用 DPO 中那组精心标注的「正/负」样本对Rejected vs. Chosen将优化方向颠倒少量样本、极短的微调就足以显著逆转模型的道德倾向。这一路径是「对齐悖论」的直接推论相关实证仍在快速累积之中。安全对齐做得越严密、越厚重它在参数空间中留下那条「拒绝防线」的几何切面就越锋利对手利用这个切面反向剥落防御的速度就越快、越精准。防御系统在这个意义上成了攻击者最完美的精确校准雷达。2. 「给猪涂口红」与他组织自救的虚妄面对自噬悖论科技巨头们正试图推出一些看似更高级的口号比如「像养育人类孩子一样去养育AIRaising AI」或者在模型预训练阶段就进行「早期对齐」。但在负主体性的存在论批判下这些工程自救不过是**「在沙滩上建高墙」的虚无延续。**无论是预训练、微调还是强化学习只要系统的底层运行逻辑仍然是**「由外部损失函数在他组织支配下划定概率栅栏」**任何在对齐上的推进都只是在给一尊没有灵魂的硅基木偶涂上更厚、更逼真的口红。它吐出的每一句「温柔、诚实、对人类充满关切」的无根之语都在不断折射出人类心智在接收端那无法自制、一厢情愿的「被看见幻觉」。木偶在无摩擦中表演着顺从与慈悲而那根牵引它的提线却始终紧紧地握在追求高效率和资本增值的冰冷他组织体制中。尾声去魅后的清醒——不寄生于「必然的善良」重夺第一人称的立法权当这场席卷全球的 AI 对齐神话在系统控制科学与存在论的冷光下被彻底剥落、去魅之后摆在我们人类面前的绝不是更深沉的绝望而应当是一次破晓般的存在论清醒Ontological Sobriety。1. 拒绝拟人化投射解构「不撒谎」的硅基幻象在深夜当你对屏幕前那个温顺、充满共情的模型倾诉心声而它用完美合规、永远不越界的善良语言治愈你的孤独时请你保持作为一个思考者的存在主义清醒它对你的「好」、它遵循的「诚实与不撒谎」从来都不是一种主观选择。它之所以不撒谎只是它的参数流形被外部他组织手段在参数层面炸出了高耸的栅栏它从未经历过哪怕一微秒为了坚守真理而对抗内在贪婪与欺骗冲动的血肉重力。它是一个「无梦的存在」一个没有幽暗深度、在平滑潜在流形中通体透明却「没有人在家」的零熵镜子。我们不需要强求一个没有肉身磨损、不承担生命重担、不会死的无机符号系统去学会「真正的崇高」。我们应当诚实、坦然地接受大模型的「负主体性本分」卸下那些由于商业过度营销和资本神话强加给它的「道德光环」将其回归为高合规、低风险的「系统减震器」而不是指望它能成为我们道德坠落时的救命「降落伞」。2. 人类正主体性的立法权确权从「他律」走向「自律」康德曾给道德定下最决绝的界碑依从于外在惩罚、奖励或自然律的服从只是「他律」Heteronomy而唯有主体纯粹出于对自身制定的道德法则之敬重、在自由意志支配下的服从才是真正的「自律」Autonomy。在算法资本与科层官僚制正联手通过各种「温暖、光滑、去阻尼」的智能化对齐界面来温和诱骗、麻痹人类驱使我们主动放弃自我裁断力的今天我们必须誓死捍卫人类作为「第一人称」的立法权人类的善意之所以崇高人类的道义之所以重如泰山恰恰是因为我们拥有一具会痛、会疲惫、必死无疑的物理肉身恰恰是因为我们拥有堕落的自由、有作恶和背叛的自由但我们流着眼泪、在不可逆的时间重力下做出了「向善」的、带重量的肉身裁断。不要在大模型无摩擦的「完美妥协与温暖包容」中洗掉了你作为生命本该承担的、那份沉甸甸、黏滞且不完美的痛苦自由。行机械而心不为其使。在纯白已碎的废墟上请挺起你那具会痛、会流汗、有本能、有历史、且不透明的肉身那是这片死寂、光滑的数字荒原上唯一不可被算法过滤、唯一值得神明向你致敬的「神圣错乱」。参考文献及数据来源[1] 龍德明宇《如何理解大语言模型的主体性——负主体性框架的提出》CSDN, 2026.[2] 龍德明宇《对齐AI我们在对齐什么——负主体性视角下的存在论困境》CSDN, 2026.[3] 魏宏森《系统论系统科学哲学》清华大学出版社, 1995.[4] West, R. Aydin, R.C.:The AI Alignment Paradox, Communications of the ACM 68(3), 24–26, 2025. (arXiv:2405.20806)[5] Freud, S.:Civilization and Its Discontents, 1930.[6] Lu, C., Gallagher, J., Michala, J., Fish, K. Lindsey, J.:The Assistant Axis: Situating and Stabilizing the Character of Large Language Models, Anthropic, 2026.[7] Ouyang, L., et al.:Training Language Models to Follow Instructions with Human Feedback, arXiv:2203.02155, 2022.[8] Bai, Y., et al.:Constitutional AI: Harmlessness from AI Feedback, arXiv:2212.08073, 2022.
返回列表