ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DeepSeek新模型三天冲到第六,大模型调用量榜在比什么

DeepSeek新模型三天冲到第六,大模型调用量榜在比什么 9月14日据每日经济新闻根据 OpenRouter 数据测算上周9月7日到13日全球大模型总调用量是127万亿 Token环比涨了10.43%。其中中国模型61.17万亿美国模型21.76万亿中国这边连续二十周排在前面。这次榜单里最扎眼的一条是9月10日刚发布的 DeepSeek V4.1 Flash上线三天就排到了第六周调用量4.94万亿 Token。先把这份数看清楚OpenRouter 是一个模型 API 的聚合平台不少开发者通过它调用各家模型。所以它统计的是经过它这一层转发出去的调用不等于全球所有 AI 算力消耗。国内云厂商自己的平台、企业私有部署、大厂内部自建的推理集群都不在这份表里。这一点挺重要。它反映的是API 外呼这一块的水位以及开发者对某几个模型的偏好但不能直接当成谁家模型最强的结论。再看榜单构成。上周全球前五里有四款是中国模型腾讯混元 Hy4 preview 以16.8万亿 Token 排第二8月28日发布并开源770B 总参数、49B 激活上下文过了 1M智谱 GLM 5.3 Flash 11.9万亿排第三环比降了4%DeepSeek V4 Flash 正式版 11.6万亿排第四降了6%小米 MiMo-V2.5 以7.77万亿升到第五环比涨了230%。上一周还在第六和第九的 MiniMax M3、GLM 5.3这周掉出了榜单。名次换得这么快是因为调用量本质是用量不是能力分。它主要被三件事推着走价格、免费额度、有没有被主流的编程或 Agent 工具设成默认后端。一个模型被某个用户量大的 AI 编程工具接成默认选项调用量几天内翻几倍很正常补贴一收、免费额度一过排名也会往下掉。之前有国产模型登顶的时候就有过很大一部分是免费额度跑出来的这类讨论。所以看到某某登顶先问一句这是付费的生产调用还是试用额度在跑数据。这次真正变了什么V4.1 Flash 是个总参数 552B 的 MoE 模型用的是新的 Causal-Encoder-Decoder 结构输入输出不对称输入激活 8B输出激活 16B。官方说它在基准测试里超过了自家的 V4 Pro性能、费用、速度、任务总用时都占优所以计划把 V4 Pro 有序下线。比分数更值得看的是缓存。官方给出的说法是新一代模型把 KV Cache 压了下来对 HBM 的需求降到上一代的 1/4对 SSD 的需求降到 1/8相对初代模型整体缩小了 437 倍。做过 Agent 的人对这个会有体感——长上下文、多轮工具调用的任务里缓存命中那部分费用往往占大头缓存小了、命中价便宜了Agent 类任务的单次成本才会真的往下走。价格也动了。据每日经济新闻报道按每百万 Token 算闲时缓存命中输入 0.02 元、缓存未命中输入 1 元、输出 4 元高峰时段分别是 0.04 元、2 元和 8 元。和上一代 V4 Flash 同时段比缓存命中输入降了 60%未命中输入降约 33%输出降约 11%。闲时是高峰的半价这个差价放到批处理场景里很实在。迁移和几个坑按官方文档模型名换成deepseek-flash就行。旧的deepseek-v4-flash名字还在但底下实际服务的是 V4.1 Flash按 Flash 的价格计费。接口兼容 OpenAI 格式SDK 不用换。# pip install openaiimportosfromopenaiimportOpenAI clientOpenAI(api_keyos.environ[DEEPSEEK_API_KEY],base_urlhttps://api.deepseek.com,)respclient.chat.completions.create(modeldeepseek-flash,messages[{role:system,content:你是帮人看服务日志的助手只讲结论和可能的排查方向。},{role:user,content:这段报错说明什么问题贴日志},],streamFalse,reasoning_efforthigh,extra_body{thinking:{type:enabled}},)print(resp.choices[0].message.content) 几个容易踩的地方**别在 prompt 开头塞会变的东西。**缓存命中输入0.02元、未命中1元高峰档是0.04元对2元都是50倍的差。很多人的 system prompt 第一行是当前时间或者随机 request_id等于每次都主动把缓存弄失效。把固定不变的部分放最前面变动的内容放后面。**离线任务往闲时挪。**闲时是半价能异步跑的批处理和回归测试没理由都挤在白天。**别把模型名写死在代码里。**这次 V4 Pro 的路由调整、文档措辞都改过几轮。模型名放配置项切换时改一行。**榜单只能当线索。**选型还是拿自己的任务集跑一遍——你自己的报错日志、你自己的文档——看准确率、延迟、每千次调用花多少钱比看排名靠谱。**多模态是原生支持的**官方说法但图像理解在自己的场景里准不准、Token 消耗多少最好自己压测别照搬发布页的对比图。 这一轮国产模型排在前面一半是价格和工具接入带来的一半确实是架构和缓存优化把成本压下去了。对普通开发者来说眼下的好消息是不必为了省钱去做模型降级。至于这份榜单是真实使用的晴雨表还是补贴撑起的虚火你怎么看评论区聊聊。
返回列表