ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

2026年8月 人工智能前沿详细总结(包括Qwen3.8-Max、DeepSeek-V4-Pro、Grok 4.6、Gemini 3.7 Flash、GLM-5.3、Qwen3.8-27B 等)

2026年8月 人工智能前沿详细总结(包括Qwen3.8-Max、DeepSeek-V4-Pro、Grok 4.6、Gemini 3.7 Flash、GLM-5.3、Qwen3.8-27B 等) 文章目录8月3日【多模态大模型】阿里发布超强模型 Qwen3.8-Max【重要】8月5日【龙虾智能体】百度文心助手成为最强国产龙虾【重要】8月13日【大语言模型】DeepSeek-V4 Pro 正式版发布【重要】【多模态大模型】SpaceXAI 发布 Grok 4.6【重要】【多模态大模型】谷歌发布新模型 Gemini 3.7 Flash【重要】【大模型 Harness】DeepSeek Harness 正式发布【重要】8月14日【大语言模型】超强开源模型 GLM-5.3 发布【重要】【模型推理优化】GPT-5.6 Sol 推出超高速模式【音乐大模型】音潮大模型 V4.0 正式发布8月15日【多模态大模型】阿里开源轻量级模型 Qwen3.8-27B【重要】8月21日【模型 Harness】OpenAI 开源 Codex Harness【重要】【多模态大模型】DeepSeek-V4-Flash-Vision-Exp 上线8月26日【多模态大模型】阿里发布新模型 Qwen3.8-Flash【重要】【AI芯片】OpenAI 发布自研 AI 芯片“小辣椒”【重要】【视频生成模型】免费视频模型 Agnes Video 2.5 系列模型上线【重要】8月27日【多模态大模型】智谱发布原生多模态大模型 GLM-5.3 Flash【重要】8月28日【视频生成模型】谷歌发布最强视频生成模型 Gemini Omni 1.1 Flash【重要】【大语言模型】腾讯发布新模型 Hy4 preview8月3日【多模态大模型】阿里发布超强模型 Qwen3.8-Max【重要】今天阿里突然发布了新一代基座模型Qwen3.8-Max。该模型的参数量达到 2.4TB在编程、专业任务、长程任务、多模态智能体等场景中的性能显著提升冲到了全球大模型的第一梯队。在编程能力上甚至超过了Claude Fable 5 (high)。在性能极其能打的同时Qwen3.8-Max把价格也打了下来。该模型的输入为 12 元 / 1M token输出为 36 元 / 1M token缓存命中输入的价格仅为 1.5 元 / 1M token比Claude Opus 5等模型便宜得多。目前Qwen3.8-Max的 API 已经上线千问 AI 平台。8月5日【龙虾智能体】百度文心助手成为最强国产龙虾【重要】今天SuperCLUE 的最新一期龙虾测评排行榜中百度的文心助手成为了国内排名第一的龙虾智能体。之后的四名分别是小米的MiMoClaw、腾讯的WorkBuddy、月之暗面的KimiClaw、MiniMax 的MaxClaw。在半个月前的 PinchBench v2 榜单上它也凭借 94.6% 的亮眼成绩获得了世界第一。文心助手在多个维度的分数都非常亮眼。在记忆维度文心助手直接获得了100分在数据处理维度也位列第一。而且文心助手截止目前仍然免费不限量。8月13日【大语言模型】DeepSeek-V4 Pro 正式版发布【重要】今天DeepSeek 正式发布了DeepSeek-V4 Pro正式版被命名为DeepSeek-V4-Pro-0813。测评结果显示该模型在多项测评中超越了Claude Opus 4.8接近Claude Fable 5。根据官方介绍DeepSeek-V4-0813的智能体能力得到了显著提升尤其是在生产环境中可以直接接入 Codex 进行使用。其推理支持 low / high / max 三档思考强度用户可以在实际使用中根据任务复杂度灵活选择。但是DeepSeek 同时宣布之后 DeepSeek 的 API 将迎来一波涨价。【多模态大模型】SpaceXAI 发布 Grok 4.6【重要】今天马斯克的 SpaceXAI 正式发布了新旗舰模型Grok 4.6。该模型的跑分反超了GPT-5.6 Sol和Claude Fable 5 Max但是价格只需要 2 美元 / 1M 输入 token、6 美元 / 1M 输出 token比前两者便宜了不少。在衡量正式工作能力的 GDPVal-AA v2 上Grok 4.6拿下了 SOTA还在另外两项测试中获得了第一。本次模型升级的重点在于长程智能体任务要求模型在长时间无人监督的情况也可以连续工作不掉线。目前Grok 4.6已经接入了 Grok Build、Cursor、Grok Bot相当于 SpaceXAI 版本的 WordBuddy和 API。马斯克表示下一代模型Grok 4.7的初步训练也已经完成正在补充训练中添加大量 SpaceX 公司的数据将在三到四周内发布届时将成为世界上最强大的模型。【多模态大模型】谷歌发布新模型 Gemini 3.7 Flash【重要】今天谷歌正式发布了新模型Gemini 3.7 Flash。本次升级重点主要在于编程、智能体应用、Web 开发和复杂知识工作上。谷歌官方将其定义为“迄今为止用于编程和智能体领域最智能的 Flash 级主力模型。Gemini 3.7 Flash在基础规模上保持了多模态输入的优势支持文本、图形、音频和视频输入上下文窗口仍然为 1M输出上限则提升到 64K Token。而且模型引入了可调整的思考配置允许用户在不同任务中灵活权衡输出质量、推理成本和响应速度。谷歌表示Gemini 3.7 Flash在遇到障碍时表现出了更强的自适应能力能够主动澄清意图并更加严谨地执行指令。同时通过在多步骤规划和工具调用中投入更多计算资源降低工程工作流中的死循环重试和人工监督需求。在实际代码调试和复杂任务解决中Gemini 3.7 Flash的生成质量相较于Gemini 3.6 Flash有了显著提升尤其擅长处理长程软件工程和生产级代码。为了吸引用户谷歌被迫通过突出性价比的方式来为模型进行宣传在2026年底之前Gemini 3.7 Flash的 API 价格减半定价为 0.75 美元 / 1M 输入 token、3.75 美元 / 1M 输出 token。【大模型 Harness】DeepSeek Harness 正式发布【重要】今天在DeepSeek V4 Pro发布之后的半天DeepSeek 继续发布了开发者预览版的DeepSeek Harness。DeepSeek Harness是一套用于构建、运行和扩展智能体的 SDK 和应用框架默认可以连接 DeepSeek 模型也可以方便地连接其他模型让模型读取项目、修改文件、运行命令、管理任务、分配子任务并通过 WebUI、全屏终端、Headless 命令或自动化协议与用户进行交互。DeepSeek Harness的设计主张是“一切皆插件”甚至连智能体循环本身也被视为插件其核心能力之外是大量的能力包。8月14日【大语言模型】超强开源模型 GLM-5.3 发布【重要】今天GLM-5.3正式发布成为当前国内最强的开源模型和编程模型甚至在编程上更加接近Claude Fable 5。在多项主流测试中GLM-5.3是当前最强的开源模型和Kimi K3达到同一水平但是它的编程体感超过了其他所有的国产模型。另外随着 Token 预算的增加GLM-5.3的编程准确率会持续上升在 High 挡位下已经可以用显著更低的 token 消耗超越Claude Opus 4.8最高挡位的准确率。GLM-5.3除了编程之外的另外一大卖点是安全在白盒安全审查中的性能不仅超越了GLM-5.2也略微超过了Claude Mythos 5和GPT-5.6 Sol成为了最强的开源安全模型。【模型推理优化】GPT-5.6 Sol 推出超高速模式今天OpenAI 联合芯片厂商 Cerebras 正式预览了其旗舰模型GPT-5.6 Sol的全新服务层级“超高速模式”。在该模式下GPT-5.6 Sol的输出速度最高可达 750 tokens/s相较于之前的标准模式约 53 tokens/s 的推理基线速度最高提升 14 倍同时不降低任何质量。横向对比Claude Fable 5GPT-5.6 Sol经过加速后快 11 倍比Claude Opus 4.8在 Fast 模式下还快五倍。目前超高速模式将率先在 OpenAI API 中推出目前已经面向部分客户推出了有限预览版。【音乐大模型】音潮大模型 V4.0 正式发布今天音潮大模型 V4.0正式发布该模型相较于上一代的音潮大模型 V3.5在指令理解、情绪落地和曲风细分三个维度有了极大的进展。实测结果显示音潮大模型 V4.0能够精确掌握每一种乐器的音色特质。另外音潮大模型 V4.0还补充了几大优点语种全覆盖、纯音乐生成免费开放。8月15日【多模态大模型】阿里开源轻量级模型 Qwen3.8-27B【重要】今天阿里正式发布并开源了模型Qwen3.8-27B该模型以极小的参数量在多项软件工程和智能体评测中的表现超越了Claude Opus 4.6 Max。在智能体评测榜单 SWE-bench Pro 上Qwen3.8-27B不仅超越了Qwen3.7-Plus也超越了Claude Opus 4.6在考验真实软件能力的 QwenSWEBench 上更是显著领先Claude Opus 4.6。Qwen3.8-27B支持 262K 上下文具有原生多模态能力重点强化了编程、专业工作和长程智能体能力。另外模型还支持 xhigh、medium 和 low 三档推理深度。8月21日【模型 Harness】OpenAI 开源 Codex Harness【重要】今天OpenAI 正式宣布全面开源Codex Harness。【多模态大模型】DeepSeek-V4-Flash-Vision-Exp 上线今天DeepSeek 正式发布了首款多模态大模型DeepSeek-V4-Flash-Vision-Exp并将其上线了 DeepSeek API 平台。DeepSeek-V4-Flash-Vision-Exp在纯文本能力上基本与DeepSeek-V4-Flash-0731持平但是小有优势但是在需要视觉理解的评测中相较于DeepSeek-V4-Flash-0731出现了大幅提升多模态能力已经接近Claude Opus 4.8。根据官方介绍目前的DeepSeek-V4-Flash-Vision-Exp只是一个实验性版本并非正式的模型。8月26日【多模态大模型】阿里发布新模型 Qwen3.8-Flash【重要】今天阿里发布了新模型Qwen3.8-Flash并且同步开源了Qwen3.8-Flash-Next。两者为同一模型前者是 API 的调用名称后者是开源版本的正式名称。Qwen3.8-Flash在智能体编程基准 DeepSWE 上取得了 58.7 分而它的上一代参数规模是它三倍的Qwen3.7-Plus只获得了 16.5 分。在长周期办公任务和专业岗位任务的评测集上的得分也明显超越了Claude Opus 4.6 (Max)。在多模态方面多个基准测试的成绩也十分优秀在一些方面超越了Claude Opus 4.6和DeepSeek-V4-Flash-0731。Qwen3.8-Flash的最大卖点为价格1元 / 1M输入 token、3元 / 1M 输出 token仅为月初发布的Qwen3.8-Max的十二分之一也低于DeepSeek-V4-Flash在调价后的闲时价格。【AI芯片】OpenAI 发布自研 AI 芯片“小辣椒”【重要】今天OpenAI 发布了自研的芯片“小辣椒”该芯片在跑分上竟然碾压了英伟达最强的芯片Blackwell。不只是官方半导体深度研究机构 SemiAnalysis 受邀给出的实验室实测结果显示该芯片几乎可以在所有场景中击败Blackwell。“小辣椒”具有低延迟、高吞吐、高并发 SOTA 级别的表现而它的内核很大一部分都是由 Codex 进行编写的。【视频生成模型】免费视频模型 Agnes Video 2.5 系列模型上线【重要】今天新加坡的明星 AI 实验室 Agnes 发布了新的视频生成模型Agnes Video 2.5系列目前已经上线了该实验室的创作平台。Agnes Video 2.5系列模型共有两款分别是Agnes Video 2.5 Flash和Agnes Video 2.5。前者开源免费使用适合 AI 短剧创作者进行大量的视频生成和前期尝试后者每秒消耗 2 积分最高可以生成 100 秒的视频支持多图和音视频参考和 2K 分辨率。从能力上说Agnes Video 2.5已经进入了全球视频生成模型的第一梯队。每天可以在 Agnes 创作平台免费领取 200 积分。8月27日【多模态大模型】智谱发布原生多模态大模型 GLM-5.3 Flash【重要】今天智谱刚刚发布并开源了新模型GLM-5.3 Flash。该模型在 OpenRouter 上首日就冲上了榜首海刷新了单日 token 用量历史记录。模型尺寸方面GLM-5.3 Flash仅有 320B但是却在能力上全面超越了参数规模为 753B 的 GLM-5.2综合能力更是略微超过DeepSeek-V4-Vision-Exp接近Claude Opus 4.8。在价格方面GLM-5.3 Flash的定价是GLM-5.3的十分之一和Claude Opus 4.8的二十分之一并且还有限时的五折优惠。其定价比DeepSeek-V4-Flash还更低。另外GLM-5.3 Flash使用纯国产芯片进行训练。8月28日【视频生成模型】谷歌发布最强视频生成模型 Gemini Omni 1.1 Flash【重要】今天谷歌发布了新的视频生成模型Gemini Omni 1.1 Flash。该模型在 Arena.ai 竞技场中获得了文生视频榜单第一名超越了Gemini Omni Flash、FLUX 3 Video、Dreamina Seedance 2.0和Dreamina Seedance 2.5在图生视频榜单效果仅次于MiniMax H3同样超越了 Seedance 系列模型。Gemini Omni 1.1 Flash的更新重点集中在视频制作流程的连续性、可控性和迭代效率。在场景延展能力上Gemini Omni 1.1 Flash可以读取最多 10 秒的前序视频上下文并在此基础上生成后续画面单次可扩展 10 秒累计视频长度最高可以达到 40 秒。上下文长度的提升让它可以获得更多的人物状态、场景关系、镜头运动和剧情信息对于连续对白、长镜头和叙事视频等需要多段生成的视频项目可以显著提升视频生成结果的一致性。Gemini Omni 1.1 Flash还增加了首尾帧控制功能用户可以指定一个镜头的起始画面和结束画面由模型补充中间的连续运动。在制作效率上Gemini Omni 1.1 Flash提供了 360p 草稿模式其生成速度比 720p 情况下提高了大约 60%生成成本约为三分之一适合创作前期。在草稿确定后用户可以基于草稿进入高分辨率生产阶段。输出效果上Gemini Omni 1.1 Flash支持将视频提升到 1080p 或 4K 分辨率。【大语言模型】腾讯发布新模型 Hy4 preview今天腾讯混元发布并开源了新一代大模型Hy4 preview。该模型的参数量达到了 770B单次激活 49B支持 1M 上下文在编程、办公、游戏和科学研究场景进行了重点升级。Hy4 preview相较于Hy3 preview在参数量、激活参数和上下文长度都得到了极大提升。从评测结果来看Hy4 preview在 Code Arena: WebDev 榜单上达到了第五名超越了Grok-4.6 (High)、GPT-5.6 Sol (xhigh)、Qwen3.8-Flash-Next、GLM-5.3 Max等众多竞争对手。价格方面模型的输入为 6元 / 1M 输入token缓存命中时为 0.3元 / 1M 输入token18 元 / 1M 输出token。另外在 WorkBuddy 和 CodeBuddy 中还将开启两周的限时免费体验。目前Hy4 preview的模型权重以及 FP8 版本已经全部开放。
返回列表