/ ai资讯

全球大模型调用量第一!DeepSeek V4-Flash登顶,中国大模型横扫全球榜单

发布时间:2026-08-06 15:46:14

短短10天,中国AI大模型公司上演了三个大动作,掀起了一轮密集的创新潮流。DeepSeek V4 Flash版本、Kimi K3和Qwen3.8-Max陆续上线,在美国硅谷引发了集体的振动。

这三款模型都在与 GPT-5.6 和 Claude Opus 5 等美国AI模型方案展开激烈竞争。值得关注的是,真正的战场已经不再仅仅是跑分榜单了:现在更关键的是单次响应的服务成本,以及究竟有多少 GPU 算力能够满足庞大的市场需求。

最新业界消息显示,多模型聚合平台 OpenRouter 发布的全球 AI 大模型调用量周榜单(7 月 27 日至 8 月 2 日)显示,DeepSeek V4 Flash 以 7.22 兆 Token 的调用量位居第一。排在第二位的是小米MiMo-V2.5,周调用量6.3万亿Token,环比下滑40%;第三名是来自腾讯自研大模型混元Hy3,周调用规模4.82万亿Token,环比增长22%;第四名是同样来自DeepSeek的V4-Flash 0731模型,这是DeepSeek全新上线的新版本模型,周流量3.28万亿Token,环比增长3%;智谱GLM-5.2位居第五,周调用量达2.89万亿Token,环比下滑12%。

国际研究机构Artificial Analysis的最新分析显示,DeepSeek-V4-Flash 在全球知名模型中具备突出的成本效益 ,V4-Flash 的平均测试成本仅为3美分,OpenAI GPT-5.6 Sol 为1.86美元,Claude Fable 5 高达3.15美元 。

DeepSeek V4 在长上下文任务中主打价格与效率优势

7月31日, DeepSeek 推出了V4 Flash正式版本API,并且开始公测,该模型并没有增加模型参数,而是通过优化后训练环节,大幅度提升Agent能力,整体性能逼近国际顶尖水平。

V4 Pro 的总参数量达到 1.6 万亿,每个词元(token)激活 490 亿参数;V4 Flash采用MoE(混合专家)结构,总参数规模缩减至 2840 亿总参数和 130 亿激活参数。两者均提供 100 万 token 的上下文窗口。在官方DeepSWE基准测试中,其表现较此前V4-Pro预览版版本提升超过6倍。

V4 Flash核心改进主要集中在推理能力、工具调用以及智能体(Agent)行为上。初步测试表明,该模型在编程任务中产生的幻觉响应更少,给出的答案也更加清晰。V4 Flash延续了此前极低的定价策略,输入命中缓存价格仅为0.02元/百万Token,未命中输入价格为1元/百万Token,输出价格为2元/百万Token。

DeepSeek 还推出了分时定价策略。在北京时间的高峰需求时段,费率会上涨;而在非高峰时段则会下调。这种在电力、交通或云计算容量市场中常见的定价模式,在目前的 AI API 领域还十分罕见。

外媒指出,在非高峰时段,V4 Pro 的价格约为每百万 token 0.87 美元,而 V4 Flash 则降至约 0.28 美元。这些价格远低于美国高端模型。

在进行对比时,不能仅仅考虑单个 token 的成本:较便宜的模型可能会生成更长的回复、需要更多次尝试或产生错误,从而推高整体成本。尽管如此,如此显著的价格差异,仍足以让许多企业考虑将 DeepSeek 用于文本分类、数据提取、常规代码生成或大规模自动化流程。

另一个值得注意的变化是,官方移除了旧的接口标识符 deepseek-chat 和 deepseek-reasoner。开发者必须迁移到新的 V4 Pro 和 V4 Flash 命名,以便更精准地控制所使用的模型版本。

Kimi K3拥有2.8万亿参数,最强开源模型追平闭源大模型部分参数

Kimi K3 是一款拥有 2.8 万亿参数的大模型,基于混合专家(MoE)架构构建。这种设计并非在每次查询时都激活所有参数,而是通过路由系统挑选最合适的专家来处理每个词元(token)。与同等规模的稠密模型相比,这大幅降低了计算负载。融合了3D推理、编程与视觉能力,K3自己做的3D游戏非常逼真,还可以互动。K3复刻的黑洞,可以用于科学编程,中国可回收的远程火箭3D建模动画,K3可以实现。运用Agent能力,K3可以48小时运行,独立完成从芯片的构建、设计到优化、验证的全流程。运用原生态的多模态架构能力,可以运用多种素材剪辑视频。

然而,这并不意味着它的部署成本低廉或操作简便。月之暗面建议,至少使用配备 64 个加速器的超级节点,以维持专家之间的高带宽通信。在完全精度下,完整的模型权重需要约 1.5 TB 的存储空间;即使采用 4-bit 量化版本,仍需要大约 600 GB 的显存。

尽管 Kimi Delta Attention 架构显著减少了用于在生成过程中维持上下文的 KV 缓存(键值缓存)的内存分配,但这一改进并未消除模型对物理硬件的硬性要求。对于每一个请求,公司依然需要庞大的高带宽内存、互联带宽以及充足的可用 GPU。

Kimi K3 的发布导致日销售额和 API 调用量激增,促使月之暗面将订阅服务拆分为两款独立产品:一款涵盖网页端应用、办公功能及常规 Kimi 服务;另一款则是专为编程任务打造的 Kimi Code。

Qwens 3.8-Max,主导2.4万亿参数的旗舰模型

8月3日,阿里宣布推出Qwens3.8-Max,这款模型总参数量2.4万亿,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。阿里官方宣称,这款模型上线当天,根据权威三方榜单Arena中,整体性能处于全球大模型第一梯队。

该模型全面支持文本、图像、视频和文档处理。它具备近 98.4 万 token 的上下文窗口,且单次生成的响应长度最高可达 131,072 个 token。

此外,阿里巴巴还加入了可调节的推理力度选项(范围从“低”到“超高”),以便根据任务的难易程度来优化资源分配,且该推理功能默认处于开启状态。

目前,Qwen 3.8 Max 已通过阿里巴巴的 Token 套餐,以及 Qoder 和 QoderWork 平台提供服务。该服务兼容 OpenAI 和 Anthropic 协议,这意味着许多现有应用只需切换接口端点,即可无缝接入,无需进行全面的重新集成。

阿里云提示:1. Qwen3-8B:82 亿参数开源密集型轻量模型,本地显卡可私有化部署,永久开源商用;

2. Qwen3.8-Max(预览版):2.4T 万亿参数旗舰 MoE 模型,当前仅支持阿里云线上 API 调用,正式版后续将开源,暂不提供本地部署权重。

据悉,Kimi K3(原生支持文本/图像/音频/视频)和Qwen 3.8 Max(原生支持图像/视频/文档,并具备 RecreationBench 等 GUI 代理功能)。GLM 5.2 以文本为主(视觉功能通过配套模型实现),而 DeepSeek V4 Flash 0731 仅支持文本。

中国大模型可以做到低成本,主要是通过开源路线或者开放权重路线。这种策略的好处是,使用者不仅可以下载、使用和微调大模型,还可以在本地服务器或者自主环境中运行,并且根据医疗、金融、汽车和制造等具体行业需求进行调整,而不必依赖模型厂商提供的在线接口。好处是不仅可以加快技术迭代,还可以显著降低中小企业使用的门槛,使其不必从零基础模型做起,而是直接在成熟的模型上进行行业适配。

免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。

如有疑问请发送邮件至:bangqikeconnect@gmail.com