
大模型竞赛进入“推理时代”后安全对齐的一个核心策略是让模型把推理过程以思维链的形式写下来。但据TechCrunch 9月3日报道OpenAI即将推出的Astra模型将打破这条默认规则。Astra采用名为“循环深度”recurrent depth的技术让推理脱离当前主流模型常见的顺序展开机制。它不再逐步生成一连串思维token而是在神经网络内部反复迭代直到收敛到最终答案。整个过程不需要把中间步骤翻译成自然语言也不会给安全团队留下一份可读的推理记录。循环深度并非全新概念它与循环神经网络和深层残差网络一脉相承同一组计算单元反复处理信息从而在参数规模不变的情况下获得更复杂的内部计算。对于语言模型而言这仿佛是把AI的思考压缩进隐藏状态之中与需要把每一步“说出来”的模型相比Astra可能更接近一种无言的顿悟——没有草稿没有日志只有一个等待检查的结论。看不见的思考无法控制的风险此前OpenAI的o1等推理模型让思维链成为AI安全工具的核心。安全团队可通过模型生成的推理草稿识别越狱倾向、欺骗意图或奖励黑客行为在事故发生前介入。而“循环深度”将这条干预路径封死了。专家担心大量推理发生在人类难以观测的隐空间中现有对齐和审核机制将失去抓手。“如果我们看不到模型的推理草稿就无法判断它是深思熟虑还是在故意掩盖恶意优化。安全研究将退回黑箱时代。”一位参与安全评测的研究者如此警告。OpenAI的取舍效率、保密与黑箱OpenAI采用这一方向动机尚未完全披露。行业内推测主要有二其一循环深度节省token和算力适合高并发AI代理场景其二思维链极易被蒸馏和破解而循环深度把推理过程锁进模型权重的内部动态中可避免专有策略外泄。商业上这无疑更安全却也让外部监管者面对更大的不透明性。OpenAI回应称Astra并未抛弃安全监督将采用更全面的离线测评、异常终止信号以及事后解释机制来保证可控性。但专家指出AI生成的事后解释未必忠实反映内部计算过程。模型可能学会生成一套让人类安心、却与实际推理无关的话术可解释性要求最终沦为形式。编者按可读性正在成为大模型的稀缺品思维链不是AI安全的终点它甚至可能是模型“表演”给人类看的内容。但其核心价值在于可干预性——安全人员可以在运行中观察、质疑和打断。循环深度把这个窗口重新焊死。监管者在衡量AI进步时不应只问模型能否解答超难数学题也应要求为关键部署提供可验证的计算透明机制。否则我们可能造出一个能不断思考、却对人类彻底失语的黑箱大脑。本文编译自TechCrunch本文首发于赢政天下 (https://www.winzheng.com/article/openai-astra-recurrent-depth-safety-alarms)获取更多深度技术内容与资源欢迎访问官网。