行业资讯
谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练
Google刚刚一口气发布了3款Gemini新模型Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。3.6 Flash用更少的Token干更多的活3.5 Flash-Lite把输出速度拉到每秒350个Token3.5 Flash Cyber则专攻代码安全漏洞的发现和修复。三款模型三个方向目标一致让AI Agent在生产环境里真正跑起来跑得起。更少的Token更强的活先说3.6 Flash。Google把它定位为工作主力模型直接对标自家上一代3.5 Flash。开发者和客户反馈最多的痛点是Token消耗太高推理步骤太多工具调用太频繁跑一个多步骤工作流下来账单看着心疼。3.6 Flash直接回应用户需求。根据Artificial Analysis Index的测量完成同样的任务3.6 Flash比3.5 Flash少用17%的输出Token。在Datacurve的DeepSWE基准上这个差距拉到了65%。更少的推理步骤更少的工具调用多步骤工作流跑下来整体成本实打实地降了。3.6 Flash在OSWorld验证任务中展现了比3.5 Flash更好的Token效率和更少的冗余输出。性能全面超越3.5 Flash价格更便宜。写代码这块DeepSWE得分从37%涨到49%精度更高不想要的代码修改更少执行循环也减少了。机器学习研究方面MLE Bench从49.7%跳到63.9%进步相当明显。计算机操作能力也有提升OSWorld-Verified从78.4%涨到83.0%。值得一提的是Computer Use计算机操作现在作为内置的客户端工具直接集成在Gemini API和Gemini Enterprise里了不用再额外折腾。知识工作方面GDPval-AA v2得分从1349涨到1421。Hebbia和Harvey这些客户已经在用了反馈说3.6 Flash在多模态任务上表现突出文档解析、图表和数据分析、报告起草都有提升。例如3.6 Flash在Gemini App中使用画布功能帮助开发用于3D工作流的摄影纹理提取器。3.6 Flash使用Google Antigravity和tldraw离线编辑器能凭借强大的视觉理解能力构建交互式主题工作室。安全方面3.6 Flash出厂就带着增强版Frontier Safety前沿安全防护覆盖化学、生物、放射性和核CBRN以及网络攻击滥用领域。抗越狱能力大幅增强同时针对正当用途做了训练尽量减少误拒。每秒350个Token3.5 Flash-Lite走的是另一条路快便宜能扛量。Artificial Analysis测出来的数据是每秒350个输出Token3.5系列里最快。价格压到了输入每百万0.3美元输出每百万2.5美元。它的设计思路是给开发者一个灵活的旋钮。高吞吐、低延迟的场景比如Agent搜索、文档批处理把thinking level调到minimal或low成本极低速度极快。遇到多步骤子Agent工作流把思考等级拉高模型也能胜任。Computer Use同样作为内置工具集成进来了。对比上一代3.1 Flash-Lite性能有显著提升。Terminal-Bench 2.1从31%涨到54%长上下文GDM-MRCR v2从60.1%涨到72.2%真实任务执行GDPval-AA v2从642涨到1140。3.5 Flash-Lite在不少Agent和编码评测上甚至超过了上一代的3 Flash。SWE-Bench Pro拿到54.2%3 Flash是49.6%。OSWorld-Verified拿到74.0%3 Flash是65.1%。一个Lite版跑赢了上一代的标准版速度还更快。3.5 Flash-Lite能从庞大的电商数据集中提取产品特征并进行综合。3.5 Flash-Lite与3.6 Flash作为主Agent协同工作可以实现即时生成25个独特的、可探索的网页设计概念。给代码找漏洞AI发现安全漏洞的速度已经超过了现有系统修复漏洞的速度。这个缺口越拉越大光靠人盯不现实。Gemini 3.5 Flash Cyber基于3.5 Flash微调专门针对网络安全漏洞的发现和修复做了优化。它的定位是嵌入CodeMender代码修复器这个代码安全Agent里。CodeMender内部跑多个3.5 Flash Cyber Agent协同工作最终输出一份合并报告。在CyberGym这个主流基准上这套组合达到了前沿水平的竞争力同时每Token成本比大模型低得多。因为这项技术天然具有双重用途能找漏洞也能被滥用Google在部署上非常谨慎。3.5 Flash Cyber不会公开发布仅通过CodeMender向政府和受信任的合作伙伴提供作为限量访问试点项目的一部分。目的是让一线防御者抢在攻击者前面发现和修复关键漏洞同时控制滥用风险。而人们期待已久的Gemini 3.5 Pro呢Google说正在和合作伙伴测试准备好了就广泛开放。团队已经启动了Gemini 4的预训练官方原话是迄今最有野心的一次预训练运行。参考资料https://x.com/GoogleAIStudio/status/2079633334485811523https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/https://storage.googleapis.com/deepmind-media/gemini/gemini_3-6_flash_model_evaluation.pdf
郑州网站建设
网页设计
企业官网