
过去几年AI行业几乎每隔几个月就会出现一个新的模型。从GPT-3、ChatGPT到GPT-4、Gemini再到o1、DeepSeek-R1、Claude Computer Use和各种Agent产品模型名字越来越多能力排行榜也越来越长。我们发现过去几年的AI演进其实有一条非常清楚的主线AI正在从“生成内容”逐渐走向理解环境、推理问题、调用工具、执行任务和完成工作。换句话说真正发生变化的不只是模型越来越聪明而是AI能够承担的“工作单位”越来越大。这件事情对制造业尤其重要。因为制造业真正需要的从来不只是一个能够回答问题的大模型而是AI能不能进入生产流程理解现场、分析异常、调用系统、协同决策最终把数字世界里的判断转化为真实的生产动作。从这个角度重新看过去几年的AI会发现从Generative AI、Reasoning AI到Agentic AI和Physical AI本质上是一条从“会回答”走向“会工作”再走向“会执行”的路线。一、从GPT-3到AgentAI能力边界是怎样一步步扩大的2020年前后大模型行业最核心的问题还是Scaling模型是不是足够大、数据是不是足够多、计算量是不是足够高。OpenAI在2020年关于语言模型Scaling Law的研究中已经表明模型性能与模型规模、数据规模和训练计算量之间存在相对稳定的幂律关系。这套逻辑随后推动了大模型能力快速提升。但接下来的几年里行业竞争的重点不断变化。从“能不能生成”到“能不能理解”再到“能不能推理”和“能不能行动”AI能力边界开始持续向外扩展。阶段时间代表公司与模型/产品关键变化AI新增的核心能力Foundation Model2020前后OpenAI GPT-3大规模预训练与Scaling成为主线会生成文字、代码、摘要、翻译Chatbot2022OpenAI ChatGPT / GPT-3.5RLHF与对话交互降低大模型使用门槛会对话理解用户意图并持续交互Multimodal AI2023—2024OpenAI GPT-4 / GPT-4oGoogle Gemini 1.0 / 1.5文本、图像、语音、视频和长上下文开始融合会感知从理解一句话扩展到理解复杂信息环境Reasoning Model2024—2025OpenAI o1DeepSeek-R1Google Gemini 2.5强化学习、Thinking与推理计算成为新的扩展方向会推理处理数学、代码、科学和复杂决策问题Agent / Computer Use2024—2025Anthropic Claude Computer UseOpenAI Operator模型开始直接操作GUI、浏览器和数字工具会行动不只是回答而是执行具体任务Long-horizon Agent2025以后Anthropic Claude 4OpenAI GPT-5等推理、工具调用、记忆和长流程执行进一步融合会完成工作持续处理复杂、多步骤任务Physical AI正在发生机器人、自动驾驶、智能工厂AI从数字环境进一步连接机器人和自动化系统进入物理世界感知、决策并驱动物理执行GPT-3阶段解决的问题是“AI能不能生成像人一样的语言”真正改变了人与模型的交互关系。过去需要通过API、Prompt Engineering调用模型ChatGPT则把模型变成了可以连续交流的助手大模型第一次真正成为大众级产品。到了GPT-4o和Gemini 1.5多模态开始进一步改变AI的输入边界。GPT-4o可以统一处理文本、视觉和音频信息而Gemini 1.5 Pro将长上下文能力扩展到百万Token级并能够同时处理大量文本、代码、图像、音频和视频信息。AI开始从“理解一句话”逐渐向“理解一个复杂信息环境”发展。2024年底到2025年变化再次加速。OpenAI o1、DeepSeek-R1、Gemini 2.5等模型把行业注意力从单纯的预训练规模进一步带向Reasoning。DeepSeek-R1在后训练阶段大规模使用强化学习提升数学、代码和逻辑推理能力Google也直接将Gemini 2.5定义为“Thinking Model”强调模型在回答之前进行推理。2024年10月Anthropic为Claude 3.5 Sonnet加入Computer Use能力使模型能够观察电脑屏幕、移动鼠标、点击按钮和输入文字。2025年OpenAI推出Operator及其背后的Computer-Using Agent让AI能够观察网页、制定多步计划通过点击、输入和滚动完成任务并在遇到问题时进行自我修正。这意味着AI第一次完成 “Goal → Plan → Tool → Action → Observation → Next Action”整个执行动作。到了Claude 4和GPT-5行业进一步向Long-horizon Agent推进。Anthropic在Claude 4发布时明确强调其对复杂、长时间运行任务和Agent Workflow的持续执行能力Claude Opus 4甚至被用于连续数小时的复杂任务GPT-5则进一步强化了Coding、Agentic Tasks以及长链工具调用能力。因此如果把这些模型名称全部拿掉过去几年的AI演进实际上可以被压缩成一条非常简单的路径会生成 → 会对话 → 会感知 → 会推理 → 会调用工具 → 会执行任务 → 会完成工作。而下一步正在从数字世界继续走向物理世界。二、真正的变化AI竞争正在从“模型能力”走向“工作完成能力”如果第一阶段的大模型竞争核心还是谁的模型更大、知识更多、Benchmark更高那么现在AI行业正在进入一个明显不同的阶段。未来几年的竞争重点很可能不再只是模型本身而是谁能让AI更稳定、更长期、更低成本地完成真实工作。这背后至少有四个非常明显的趋势。从“回答问题”走向“完成目标”过去用户与AI交互时最常见的方式是提出一个问题然后等待一个回答。这种交互方式决定了模型主要被当作“知识工具”或者“内容生成工具”。但Agent出现之后输入正在从“问题”变成“目标”。例如过去用户会问“这份质量报告里有什么异常”未来更可能是“找到这批产品良率下降的原因并给出处理方案。”这两句话看起来差别不大但背后对AI能力的要求完全不同。前者只需要分析一份材料。后者需要AI自己判断应该查询哪些数据需要调用哪些系统应该先看设备还是质量是否需要进一步查询历史案例什么时候信息已经足够最后如何形成一个可执行方案。这意味着“目标完成”会逐渐取代“回答质量”成为衡量AI能力的重要指标。从单次推理走向Long-horizon Workflow第二个明显趋势是AI处理任务的时间尺度正在拉长。早期大模型的工作大多发生在几十秒以内。输入一个Prompt生成一个结果任务结束。但真实工作通常不是这样的。一个采购分析、一项软件开发、一轮质量异常处理或者一次生产计划调整都可能持续几十分钟、几个小时甚至跨越多天。因此下一阶段AI真正困难的问题不是某一步能不能做对而是连续几十步以后还能不能把整件事做对。这要求AI具备过去单轮模型并不强调的能力保持长期目标、记住已经完成的步骤、识别中间结果、发现错误、重新规划、调用多个工具、在环境发生变化时调整策略。也就是说未来Agent的核心能力会越来越接近一个“持续运行的工作系统”而不是一个更聪明的聊天机器人。从“一个超级Agent”走向“Agent协同系统”第三个趋势是行业开始逐渐意识到真正需要的可能不是一个无所不能的超级Agent。因为真实工作天然就是专业分工的。一个模型同时负责财务、采购、研发、生产、质量、设备和法律不仅很难做到每个领域都足够专业权限管理和责任边界也会越来越复杂。因此更加现实的方向是专业 Agent 之间协同。不同职能的Agent分别拥有不同的数据权限、工具和专业知识再通过更高层的协调机制共同完成一个复杂工作。所以说不是简单比较“哪个模型最聪明”更重要的是哪个AI系统能够把模型、工具、数据、权限、流程和不同Agent组织起来稳定完成复杂任务。从数字世界进一步走向物理世界AI开始向Physical AI发展。到目前为止大多数Agent的行动仍然发生在数字环境里。但真实世界还有大量工作并不存在于电脑屏幕里。搬运物料、插入线缆、操作设备、完成装配、巡视厂区等等这些任务都需要AI理解真实环境再把判断转化为物理动作这就是Physical AI。如果说Agent解决的是AI如何使用数字工具。那么Physical AI解决的就是AI如何使用物理世界中的工具和身体。机器人、AMR、人形机器人、自动驾驶以及各种自主设备本质上都会成为AI新的执行终端。三、对制造业来说AI正在从“辅助工具”进入生产闭环制造业真正困难的从来不是生成一个答案而是把一个判断安全、稳定、及时地变成一个生产动作。以一个最常见的质量异常为例。假设某条生产线突然出现良率下降。如果使用早期的Generative AI可以做什么它可以帮工程师搜索SOP、整理历史异常案例、解释某个工艺原理甚至根据输入的信息生成一份RCA报告。这些能力当然有价值但它仍然处在生产流程之外。真正处理一个质量异常工程师可能需要进一步查询当前生产批次读取设备状态对比工艺参数检查AOI结果查看过去类似异常判断潜在原因再决定是否调整参数、维修设备或者暂停某批产品。这就是Reasoning AI开始发挥价值的地方。但这仍然不意味着工作已经完成。如果分析之后还需要人重新登录MES、QMS或者设备管理系统再手工创建工单、调整任务和通知相关人员那么AI仍然只是“建议者”。Agentic AI带来的真正变化就是开始连接这些系统。例如一个质量Agent可以从MES获取生产批次从QMS读取质量数据调取设备报警比较当前参数和标准参数查询历史相似异常完成RCA给出处理建议并根据权限生成质量或维修工单。此时AI才第一次真正进入了生产流程。因此从制造业视角看过去几年的AI演进可以重新理解成四个阶段。Generative AI解决“信息问题”。它帮助人查知识、写报告、生成代码、总结SOP提高信息获取和知识工作的效率。Reasoning AI解决“判断问题”。它进一步进入质量分析、RCA、参数优化、设备诊断、计划推演等复杂场景帮助工程师缩短分析和决策时间。Agentic AI解决“流程问题”。AI开始连接MES、ERP、QMS、WMS、EAM等系统从“给出建议”进一步进入“执行任务”。Physical AI解决的是最后一公里——执行问题。当数字世界里的AI判断可以进一步传递给机器人、AMR、自动化设备和其他Physical AIAI才真正具备改变物理生产过程的能力。制造业真正需要的是AI逐渐具备三种能力理解工厂、参与决策、进入执行。当这三件事情真正连起来以后AI才会开始从生产辅助工具变成生产系统的一部分。四、工业富联科技服务在把“会回答的AI”变成“会工作的AI”当AI从生成内容走向推理决策再从Agent走向Multi-Agent和Physical AI制造业面临的核心问题也随之改变如何让AI不只是理解制造知识而是真正连接生产系统、参与业务流程并进一步与机器人和自动化设备协同形成完整的生产闭环。围绕这一方向工业富联科技服务正在推进MoMClaw制造智能体与Factory Brain工厂大脑将大模型的推理能力、Agent的工具调用能力和制造现场的系统与设备连接起来推动AI从辅助分析走向实际业务执行。MoMClaw将AI能力与制造系统和业务工具连接让Agent能够围绕具体任务进行分析、调用和执行。例如在设备管理场景中Agent可以结合设备报警、运行状态、维修记录和历史案例开展根因分析辅助生成处理建议并通过系统工具衔接后续维护流程。目前MoMClaw正围绕Equipment、Logistics、Quality、Automation及Humanoid等制造领域扩展智能体能力将AI应用从单一知识问答延伸至设备管理、质量分析、物流调度和自动化作业等实际场景。在相关应用中已实现根因分析时间缩短80%、人员效率提升15%、设备故障减少10%的成效。同时工业富联科技服务进一步构建Factory Brain工厂大脑。Factory Brain以多智能体协同为核心将生产、质量、设备、物流等专业Agent组织起来使不同智能体能够共享业务上下文、协调任务并围绕交付、质量、效率、库存和成本等目标进行综合决策。未来将进一步连接Physical AI通过机器人、AMR及自动化设备将决策转化为实际生产动作并将执行结果重新反馈给系统。AI技术的下一阶段竞争重点将进一步从模型能力转向实际工作完成能力。对制造业而言真正的价值不在于部署多少AI模型或智能体而在于能否将AI融入生产流程让数据、系统、决策与执行形成持续优化的闭环。随着Agentic AI与Physical AI加速融合制造业智能化也将从单点应用走向跨系统协同从辅助决策走向自主执行。未来制造业AI的竞争力将越来越取决于能否把模型能力转化为可规模化、可持续优化的实际生产力。