ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Sora被砍背后:OpenAI战略转向AGI与Codex,视频生成赛道迎来新格局

Sora被砍背后:OpenAI战略转向AGI与Codex,视频生成赛道迎来新格局 1. Sora的完整生命周期从2024年2月的高光到2025年的沉默1.1 那个惊艳全场的2月2024年2月15日OpenAI在官网放出了Sora的演示视频。说实话我当时看到那几条样片的第一反应是这肯定是预渲染好的不可能真生成。60秒一镜到底穿行在樱花小镇的街道上镜头稳定得像实拍玻璃杯里的水波纹、水面反射的阳光、出租车司机转头的动作这些细节在当时的文生视频产品里根本见不到。那时候市场是什么状态Runway Gen-2还在给3到5秒的短视频较劲Pika还在靠无损放大撑场面而Sora一上来就是60秒、1080P、多镜头一致。整个AI圈直接嗨了NVIDIA的黄仁勋在公开场合把它称为AI的里程碑国内一大堆自媒体连夜写视频行业要完的稿子。OpenAI的估值和声量在那段时间又涨了一截。但有个细节值得注意OpenAI当时只放出了几条精心挑选的样片并没有开放公测也没有给API。那时候有一批受邀测试者签了保密协议流出来的测试结论普遍是提示词理解能力很强但翻车率极高。这个反差其实早就埋下了。后来复盘Sora的失败很多人把它归结为竞品太强但我一直觉得问题从它那个犹抱琵琶半遮面的上线策略开始就已经注定了。1.2 Sora Turbo迟到一年的正式版直到2024年12月9日也就是OpenAI那场著名的12天Shipmas活动的第三弹Sora才以Turbo的名义正式向ChatGPT Plus和Pro用户开放。距首次亮相整整过去了十个月。这十个月里视频生成赛道的格局早就天翻地覆——可灵公测了Luma上线了Runway发布了Gen-3 AlphaGoogle也放出了Veo 2的风声。Sora不再是那个唯一的王而是带着旧王冠来参加新考试。Sora Turbo交出的答卷如何我身边有大量创作者付费试了。结论比较统一起步时间倒是比演示快了不少但生成质量距离2月样片的电影感还差得远。5秒到10秒的短视频可以看超过10秒就开始出现物理诡计——杯子在桌上放着放着就陷进去了人物走路走着走着脚就融化了水面反射经常乱跳。一条720P、10秒的片子生成一次平均要等5到10分钟高峰期排队甚至等半小时。更严重的是它没有音频。你可以生成一段有风吹草动、人说话的默片声音全靠后期自己配。同期Google已经放出了Veo 2人家一出生就带原生音频。创作者的口碑是最诚实的Sora Turbo上线两周后各大AI视频社区里的Sora新作就明显少了大家又回去用可灵和Runway了。热度这种东西来得快去得也快。1.3 数据不会说谎发布热度与留存真相从第三方流量数据看Sora Turbo上线当周的活跃用户数一度冲到数百万但次月留存率并不理想。生成成本高、等待时间长、出错率高、没有声音这四个问题叠加在一起普通用户的新鲜感最多撑两三周。你可能第一周觉得哇好神奇第二周开始嫌慢第三周就回到自己顺手的工具里了。OpenAI倒是没闲着曾经陆陆续续给Sora加了故事板、风格预设、Remix之类的功能。但说实话这些都是锦上添花最核心的可控生成始终没有突破。到了2025年Sora团队的处境从外部其实已经能感知到两位核心技术负责人先后离开团队被逐步打散并进其他产品组。直到最近OpenAI正式对外宣布砍掉Sora这个项目算是对过去一年多所有传闻的一个正式回应。这不是突然死亡而是一个漫长的、肉眼可见的衰弱过程。与其说OpenAI砍掉Sora不如说Sora在内部早就被无声无息地降级了。消息出来那天我朋友圈里没人震惊只有几个早期用Sora做过demo的开发者发了句终于官宣了。这就是它在市场上的真实地位。2. Sora输在了哪里拆解视频生成模型的三大死穴2.1 架构优势变成了成本劣势我先说技术层面。Sora采用的核心架构是DiTDiffusion Transformer简单理解就是把视频切成时空patch小碎片再用Transformer去预测这些碎片怎么组合。这个架构在2024年2月是相当领先的——它天然支持可变分辨率、可变时长这是以前用U-Net做视频生成的模型做不到的。从学术角度看Sora给整个视频生成领域指了一条明路这个贡献不能被抹杀。但问题在于视频生成本身就是暴力计算的活。一张图要扩散几十步一段视频是几十张图连在一起每一步都要算全帧的注意力。Sora的推理成本有多高业内估算生成一分钟1080P视频的算力成本在数百到上千美元级别即便Sora Turbo做了大量工程优化、把时长和分辨率限制下来它的单位成本依然远远高于文生图模型。也就是说Sora每被别人用一次OpenAI就要烧掉一笔真金白银。在商用逻辑上这叫单位经济学账算不过来。ChatGPT Plus用户每月交20美元就能用Sora重度用户一个月生成几十分钟视频OpenAI在这些人身上是纯亏的。相比之下很多垂直厂商通过限制分辨率和时长、用分块生成、LoRA蒸馏等手段把成本压到了Sora的十分之一甚至更低。一边是成本降不下来一边是用户不买账Sora从一开始就背着一个沉重的商业包袱。2.2 可控性差创作者真正需要的是命令不是抽卡从我接触的影视、广告、短视频从业者反馈来看他们对AI视频工具的核心诉求就两个字可控。你要能让女主角在第三秒回头、咖啡杯在第五秒放在桌上、镜头在第十秒从特写拉成全景。这些在传统CG流程里都是基本操作但Sora做不好。Sora的生成更像一个高级抽卡机你输入提示词出来的结果里有70%的概率能看但能不能精确符合你的分镜需求完全看运气。同一段提示词生成四次四次的人脸不一样、服装不一样、光线方向不一样。对专业创作者来说这种不可控意味着没法投入生产环境——你不能让一条广告片里的logo每次都不一样甲方会疯的。可灵在可控性上做了什么它支持首尾帧控制、镜头运动控制、局部重绘、延长生成创作体验从抽卡变成了改图。Veo 3也跟进了首尾帧。反观Sora发布大半年了连最基础的首尾帧控制都没有做利索。这是产品思路的落后不是技术路线的问题。技术团队可能觉得我能生成一个完整的场景很酷但用户要的是我能改其中一个人的表情。前者是炫技后者才是工具。2.3 没有音频、没有剪辑能力被当作玩具而非工具我特别想强调一个被很多人忽略的点视频是视听产品画面只是其中一半。Sora从Demo到下线原生音频始终缺席。而Veo 2从一开始就把音频和画面一起生成海浪声、城市噪音、人物对白都自带了。这个差距在用户体验上是一个能直接交货一个还要去剪映里另找人配音的区别。另外Sora始终没有解决多镜头一致性和分段组合的体验问题。专业视频工作流是先拆脚本按镜头逐个生成再剪辑拼接最后统一调色。Sora早期连按镜头生成都做不到只能整个场景一次生成生成了就不能改某一帧。有人拿它做MV片段可以做正经TVC没法用。所以Sora实际吸引的更多是尝鲜的C端用户和自媒体博主真正愿意付费的B端专业用户很少。一个没有进入生产工作流的产品商业价值就是空中楼阁。这也能解释为什么Sora被砍之后影视行业的反应非常冷淡——因为他们早就把它从备选工具名单里划掉了。3. 谁能替代Sora可灵、Veo、Runway们的市场收割3.1 可灵和即梦本土化迭代速度碾压Sora慢不代表别人慢。2024年年中快手发布可灵AI上来直接开放公测不需要排队、不需要邀请码而且一次性开放了图生视频、视频续写等功能。紧接着字节的即梦、MiniMax的海螺AI也杀了进来。国产视频生成模型在2024年下半年到2025年的这波攻势速度是惊人的。可灵的迭代速度真实做到了两周一个小版本。2024年下半年到2025年上半年可灵陆续上线了可灵2.0、可灵2.1在人物动作、物理规律、镜头控制上都做了针对性的优化。国内创作者为什么大量转向可灵不光是因为中文提示词理解好更因为它便宜、快、能用。工具这东西说到底拼的是顺手而不是参数最猛。我记得有一次给我的一个广告人朋友推荐Sora他用了半天就放弃了原因很直接可灵生成一条10秒片子1080P几十秒出结果几十块钱。Sora排队半小时生成出来还带物理错误我没法跟甲方交代。这句话我记到现在——用户选工具的逻辑就这么朴素谁让我省时间、省心、省钱我就用谁。3.2 Veo 3与Runway Gen-4海外厂商的补位海外这边的格局是Google Veo 3在2025年5月的I/O大会上发布直接展示了音画同步生成、首尾帧控制、场景级一致性效果相当能打。Runway则走的是电影感路线Gen-4在分镜一致性和运动控制上做了大量文章而且跟Adobe Premiere的生态做了集成直接切进了专业剪辑流程。至此视频生成赛道的头部格局就已经和OpenAI没什么关系了国内有可灵、即梦国外有Veo、Runway大家都在拼能不能进生产工作流而Sora还在能生成像样的短视频上打转。更扎心的是Google和Runway这些厂商在成本控制上做得比OpenAI好得多——他们没有ChatGPT那么庞大的用户群反而可以把资源精准投给真正高频使用的创作者和开发者。3.3 创作者的真实迁移路径我身边大量真实案例是这样的用可灵生成短视频素材ChatGPT写脚本走小红书、抖音流量路线的博主早在2024年底就完成了迁移现在工作流非常稳定。用Runway/可灵做TVC分镜预演的广告从业者在2025年初就确定了工具组合甚至已经把AI视频变成了提案时的加分项。真正坚持用Sora的反而是那些需要论文式炫技的极客和测评博主但他们的需求撑不起一个商业产品。到了2025年下半年视频生成市场的用户心智已经完成重塑提到Sora大家只会说那个曾经的王者提到生产力工具大家想到的是可灵、Veo、Runway。Sora被砍只是市场用脚投票之后的必然结果。没有任何一个产品能靠曾经惊艳过活一辈子。4. OpenAI砍掉Sora的算盘AGI叙事下的资源重整4.1 GPT-6 Astra与AGI时刻的官宣要理解OpenAI为什么砍Sora不能只看视频生成这个赛道得看OpenAI整体在押注什么。最近OpenAI的总裁公开宣布AGI时代到来各类热词里也充斥着openai:欢迎来到agi时代。这里面的核心产品逻辑已经转变从做各种媒体生成工具转向做能解决通用任务的智能体。GPT-6 Astra是这场转向的旗舰产品。它主打的是跨模态实时推理——你看一个视频、听一段语音、读一份文档Astra都能实时理解并与你对话。这种实时理解世界的能力是通用智能的方向而Sora那种离线生成一段视频的能力在OpenAI的优先级排序里越来越靠后。从战略高度看问题你就会明白Sora被砍不是因为它不好而是因为它不够重要。OpenAI的态度其实是我可以花大量算力去做一个会看世界的AI但不会花大量算力去做一个只会画画的AI。视频生成如果跟主线没有协同就会被牺牲。Sora团队后来被并进世界模型和Agent感知相关团队这个安排本身就说明了OpenAI的真实想法——他们要的是让AI理解视频而不只是生成视频。4.2 Codex与Agent化OpenAI的商业重心转移另一个重要信号是Codex。从热词里你可以看到codex – openais coding agent这种说法在2025年Codex已经成为OpenAI商业化的第二增长曲线。编码智能体的客单价高、使用频率高、付费意愿强它面向的是全球数百万程序员这是实打实的B端市场。开发者用Codex写代码、修bug、做代码审查这个场景天然适合AI而且结果可验证、付费意愿高。而Sora的商业模式呢收入主要来自ChatGPT Plus/Pro的订阅费中一小部分用户的使用。2025年初Sora单独定价、Pro版要加收费用结果用户根本不买账因为同价位有太多更好的替代品。一边是Codex这样的高客单价、高留存产品一边是Sora这种高算力、低留存、低付费意愿的项目管理层把后者砍掉是理性的商业决策不是什么情怀问题。4.3 从每个领域都做到回笼核心——大厂砍项目的底层逻辑很多公司在扩张期会犯一个毛病因为手里有钱、有算力、有品牌就觉得自己什么都能做。OpenAI在2023到2024年这两年投入了大量资源做垂直应用Sora只是其中之一。到了2025年整个AI行业的融资逻辑变了资本开始要求清晰的盈利路径。于是你看到的是一个典型的回笼动作砍掉没有差异化优势的Sora把算力、人才、钱全部集中到GPT系列主线、Codex、API生态和Agent平台上。这条逻辑跟当年Google砍掉Stadia、微软砍掉Windows Phone没有本质区别——不是项目本身一无是处而是它在公司的战略优先级里排不上号了。大厂砍项目的底层逻辑永远是机会成本我把这批GPU拿去做GPT-6的推理单位收益比做Sora高出十倍那我为什么还要留着它一个冷知识OpenAI内部做视频生成的技术骨干转岗后很多去了Agent感知和世界模型相关团队。也就是说Sora这个产品死了但它留下的世界模型技术反而可能成为GPT-6 Astra理解视频的基础。产品和技术的命运有时候是完全相反的。5. 对开发者和重度用户的实用建议5.1 Sora API关闭后开发者的三个应对方向虽然Sora的API开放范围一直很窄、多是受邀制但确实有一批开发者、创业团队在上面做了基于Sora的视频生成应用。现在项目被正式砍掉这批人得赶紧想退路。我梳理了一下合理的方向主要是三个。第一个方向是迁移到Google的Veo 3 API。Google在AI Studio和Vertex AI上都开放了Veo的接口文生视频、图生视频、首尾帧控制都支持还带原生音频。对于音视频类应用Veo目前是最接近能直接上线的选项尤其是对质量要求比较高的场景。第二个方向是迁移到国内厂商的可灵API或即梦的Seedance API。这些接口的中文理解好、费用低、迭代快而且官方对个人开发者相对友好。如果你的应用目标用户主要是中文市场这是性价比最高的方案没有之一。第三个方向是根据你的业务场景自建微调。现在主流云厂商都提供视频生成模型托管和微调服务你可以基于开源或半开源的视频基座模型做领域微调成本可控而且能拿到更多定制化的镜头控制能力。这条路门槛高一些但对有算法团队的创业公司来说反而是长期竞争力最强的选择。5.2 视频生成工具的选型对比清单我把当前主流视频生成工具的现状拉了一张表方便你直接对照做决策工具原生音频首尾帧控制中文理解成本区间适合场景Google Veo 3支持支持中等较高专业影视、广告预演、需要音画同步的场景快手可灵后续版本支持支持优秀中低短视频、自媒体、中文内容创作字节即梦/Seedance支持支持优秀中低营销素材、社交内容、短剧辅助Runway Gen-4有限支持支持中等较高电影感镜头、创意概念验证Luma Ray2有限支持支持中等中等快速原型、动态效果预览这张表的结论很清晰Sora退出之后这个市场不仅没有出现真空反而已经形成了充分竞争。对开发者来说现在的选择比2024年还要多完全不用担心没有替代品的问题。真正要花心思的是把工具和自己的业务流匹配好。5.3 与OpenAI生态继续打交道的正确姿势虽然Sora被砍了但OpenAI在很多方向上依然是不可替代的。我建议开发者把OpenAI当作通用智能基座而不是万能应用超市文本和推理任务GPT-6系列依然是第一梯队尤其适合做Agent的大脑。编码场景优先用Codex它的代码理解和多文件编辑能力是目前最强的我在实际项目里用它处理过一次大规模重构效率确实远超其他方案。Embedding、向量检索、RAGOpenAI的API依然稳定用来搭知识库、做语义搜索是没问题的。另外提醒一句如果要用OpenAI的多模态能力重点看GPT-4o/GPT-5系列原生的看图推理能力而不是指望单独的媒体生成模型。换句话说跟OpenAI合作时别再把视频生成当作他们家的卖点——他们已经亲手把这个标签撕掉了。6. 一场迟到的自我审判我的几点随想6.1 大厂做前沿产品也会叫好不叫座Sora的故事最珍贵的一点是它撕掉了大厂成功的滤镜。OpenAI拥有全球最强的研究团队、最充足的算力、最高的品牌声量依然做砸了一个看起来技术领先的产品。原因恰恰在于技术领先本身——团队执着于把模型做得惊艳却忽略了创作者真正需要的是稳定、可控、便宜、能进工作流。这让我想起很多传统互联网产品的老话技术先进性只是必要条件产品市场匹配才是充分条件。Sora在这四个字上始终没有及格。它像是一个被宠坏的天才少年每个人都夸他聪明但没有一个人愿意给他发工资。6.2 技术领先不等于产品领先我经常在社区里看到有人怀念年初的Sora样片说其实它生成质量还是不错的。我不否认它的底子好但产品从来不是实验室里的几个样片。一个产品要被用户接受需要把90%的精力花在那10%的最后十公里上降低等待时间、减少物理错误、提供可编辑能力、补上音频、做好定价。OpenAI恰恰是那种擅长做前90%的公司但它那10%的耐性在AGI的召唤面前显得太短了。所以对从业者来说真正的启发是别迷信谁的模型参数大、谁的研究论文牛要看谁能把演示变成交付。可灵、Veo们赢的不是架构是耐心和产品能力。这句话我在很多场合讲过Sora是最典型的反面教材。6.3 世界模型不会消失Sora只是换了一种活法最后说点我个人的乐观判断。Sora这个产品死了但视频生成作为能力并没有死。OpenAI把Sora团队的人和能力并进世界模型与多模态感知方向这套技术很可能在GPT-6 Astra、甚至未来的机器人视觉里继续发光。视频生成产品会慢慢变成智能体理解世界、与物理世界交互的中间层而不是一个独立的消费应用。到那时候我们再回头看Sora它就像一只提前跑出起跑线、却跑错了赛道的马。赛道没错是终点换了位置。我在AI这个行业待了这几年最大的感受就是今天被砍掉的项目往往是明天某个大系统里最不起眼但最关键的一块砖。Sora的告别不让人难过它让人清醒。
返回列表