ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GPT-6 Astra“降智”引关注:鹈鹕测试背后大模型供需矛盾凸显

GPT-6 Astra“降智”引关注:鹈鹕测试背后大模型供需矛盾凸显 一只鹈鹕引发的热潮“社区里每天有上万张鹈鹕踩单车的视频被发群里问我这个鹈鹕降智了吗”开源项目CodexRadar的发起人Lambda在GPT-6 Astra发布之后每天都收到巨量的鹈鹕视频于是他干脆在社区发起了一场“鹈鹕杯”比赛。参赛者围绕“画一只骑自行车的鹈鹕”这个任务用模型生成作品再把结果发到社区里。Lambda也没想到大家对于“鹈鹕测试”的热情如此高“深夜上线没宣传就收到快一百份投稿了。9月14日上午比赛页面的pv达到了7000多”。每次新模型上线都会有人用鹈鹕骑自行车来测试模型的能力。这是为什么呢一方面这个任务足够简单、足够直观。模型的很多复杂能力很难靠一句话迅速判断鹈鹕骑自行车却很容易让人一眼看出稳定性比如腿和踏板对不对位车轮是否跟着动动作有没有穿帮前后生成是否一致。另一方面这个任务又足够复杂。它看上去仅仅是一小句prompt背后牵扯到动作理解、时序一致性、空间关系、代码组织和连续执行能力。对一个已经进入Agent阶段的模型来说这类任务非常适合做“体感温度计”。GPT-6 Astra上线之后这个鹈鹕“更火了”原因就是这个最先进的模型“智商”很不稳定而智商却会对工作的结果产生直接的影响。鹈鹕恰好可以把这种很难量化的体感变得十分直观。鹈鹕杯比赛测模型“降智”的利器鹈鹕杯比赛分成两个赛道。Classic赛道使用统一提示词“创建一个HTML内容是SVG绘制一个鹈鹕骑自行车的2D动画”。只要模型状态正常GPT-6 Astra生成出来的鹈鹕通常会保持相对一致的质量和画面结构。但如果某一天大量用户突然发现同一个提示词下鹈鹕开始频繁踩空、车轮关系错乱、结构明显跑偏“降智”的讨论就会迅速出现。这种方法当然称不上严格的科学benchmark。一道公开且高频重复的题目也存在被模型逐渐熟悉的可能。但它非常适合观察短时间内的体感变化。用户不需要理解复杂指标看几只鹈鹕就能发现差异。Open赛道不设统一提示词参与者可以自由发挥。它更像是在测试Astra能把一个开放任务做到什么程度。其中一个作品最终做成了一部长达30分钟的“一镜到底”骑行故事。整部作品共享一条1800秒时间轴和同一位骑手地面、山川、城市、星球、车轮、羽毛和粒子全部由SVG元素组成JavaScript只负责计算位置、关节和时间。整个项目没有使用Canvas、图片、视频、外部字体或者额外的大模型接口。镜头可以连续平移、拉远和靠近所有场景都存在于同一个矢量世界中。为了控制性能屏幕之外的区域暂停绘制用户拖动进度条后所有物件会直接恢复到对应时间点不需要重新随机生成。甚至连骑车这个最容易穿帮的动作也被单独处理车轮转动和脚蹬相位由行驶距离驱动所以人物停下来之后不会出现自行车已经停住、脚还在原地空蹬的情况。作品前20分钟穿过30个城市和自然景点其中深圳一章依次出现腾讯企鹅岛、深信服大厦和人才公园后10分钟则进入宇宙从火星一路来到太阳、冥王星、黑洞再回到地球。作者还专门在作品中注明哪些内容来自现实哪些属于虚构。这个作品能看出GPT-6 Astra能力确实惊艳。Astra降智为何让大家格外敏感CodexRadar开源项目的发起人最早只是想解决自己的问题模型今天到底有没有变笨是否会影响工作质量监测额度重置可以最高效地把token额度用足。后来他把监测工具做成社区开源项目没想到迅速吸引了一批重度Codex用户一起参与众测。CodexRadar的“众测雷达”设置112道真实开源编程题由用户自己跑题结果上传后再由服务器在干净环境中重新验证。官网显示参与志愿者已经超过500人累计贡献达到百亿级Token。一个最初为了自己监测“模型智商”的小工具能吸引这么多人持续贡献额度完全是因为模型能力波动正在成为重度用户共同的痛点。Astra上线之后这种波动更影响工作。一位大模型算法工程师表示降智会直接影响自动化任务。“GPT-6降智加限流自动化任务会积累最后出现并发冲突。工单会话如果降智错误还可能通过中枢传播到其他地方最后把整个仓库搞坏。”进入Agent阶段之后一次模型调用往往只是整个任务链的一环。如果其中某一步判断出现明显偏差后续步骤可能继续沿着错误结果向前推进。任务越长这种风险越明显。也因此当模型真正进入生产流程后用户关心的已经不只是平均能力能力有没有波动同样重要。OpenAI在发布Astra时把Computer Use、专业工作、软件工程和长程Agent任务放在非常重要的位置。多位大模型领域开发者表示“Astra是有代差的强”。也正是因为这种强用户希望能够把过去一些更复杂、更长程的自动化任务去交给它所以“降智”就会更大地影响工作的实际效果。“降智”到底降了什么“降智”其实是一个很社区的说法。站在用户一侧只要同一个模型名、同一个产品入口今天明显比昨天难用就会被概括为“降智”。但从工程上看用户最后看到的结果已经由很多层共同决定。底层模型是一层推理强度是一层上下文管理是一层Harness、Skills、工具调用、模型路由、并发调度和服务容量也都会影响最终效果。所以用户感受到的“变笨”并不一定意味着模型权重本身发生了变化。比如一个Coding Agent原来会主动跑三轮测试现在只跑一轮原来会调用多个子Agent检查结果现在减少了并行探索原来可以保留更完整的上下文现在长任务里丢失了一些早期信息。对后台而言这些可能对应完全不同的问题对用户而言最后的体感都是怎么感觉没以前聪明了。这也是CodexRadar出现的原因。发布时的模型的benchmark分数能看出模型的峰值能力有多高但是却很难看出模型的实时状态比如今天上午10点调用的Astra究竟处于什么状态。但对于用Agent真正工作的人来说这种实时状态十分重要。“降智”背后的问题目前并没有公开证据能够证明OpenAI在大规模主动把Astra替换成更弱的底模。但Astra上线后的供给压力已经有比较明确的信号。9月10日OpenAI暂停了每月200美元的Pro 20x套餐新订阅和升级。现有用户暂时不受影响。这个套餐提供约为Plus 20倍的使用额度也是重度Codex用户的重要选择。Astra本身又是一款昂贵的模型。其API标准价格为每百万输入Token 10美元、输出Token 50美元Fast mode可以提供更高速度价格还会再翻一倍。问题在于Astra最受欢迎的能力恰好又很“烧算力”。Computer Use需要持续理解屏幕、执行操作、观察结果再决定下一步多Agent工作流还可能同时启动多个子任务Coding Agent一次完整任务会不断读取文件、执行代码、运行测试、回看结果。当大量重度用户同时开始这么使用模型供给压力和过去已经完全不是一个量级。所以这轮“降智”讨论背后实际混合了模型质量波动、限流、资源调度以及长任务本身对系统稳定性的放大。社区里有人认为最近的问题与Astra需求过强、Pro 20x用户大量涌入和算力供给紧张有关。但OpenAI暂停20x新增订阅至少证明了这个前沿模型出现了很真实的供需矛盾。大模型开始需要“智力SLA”一只鹈鹕成为Agent时代的明星说明用户在主动监控“智能”本身。模型在不同时间段的任务成功率、长任务稳定性以及同一个workflow能否持续复现。可以把它理解成一种新的“智力SLA”。SLA原本是Service Level Agreement服务等级协议。云服务里通常约定可用率、延迟、故障恢复时间这类指标比如99.99% uptime。模型越强这个问题反而会越突出未来模型公司的竞争也会从峰值能力进一步延伸到另一层把高水平智能长期、稳定、规模化地供应出去。模型能不能每天都一样聪明也成为了AI Agent真正走向工作场景的一个卡点。这不禁让人思考大模型的“智力SLA”该如何建立和保障呢
返回列表