潮水的方向:中国大模型的集体崛起与全球AI格局重塑
引言
2026年春天,一组数据震动了全球AI圈:中国AI大模型的周Token调用量达到12.96万亿,是美国的4.27倍,连续五周超越美国。全球调用量排名前六的模型,全部来自中国。
这不是偶然的爆发,而是一场酝酿已久的结构性逆转。
从DeepSeek V4以1/30的价格挑战GPT-5.5,到阿里Qwen3.6 Plus登顶全球调用量榜首,再到MiniMax M2.7成为首个”自我进化”的开源模型——中国大模型正在以一种前所未有的方式,重新定义全球AI竞争的规则。
今天这篇文章,我们来拆解这场崛起背后的逻辑。
一、12.96万亿Token:一个改变格局的数字
根据全球最大AI模型API聚合平台OpenRouter的最新数据:
中国AI大模型周调用量:12.96万亿Token(环比增长31.48%)
美国AI大模型周调用量:3.03万亿Token(环比仅增0.76%)
中国是美国的4.27倍,差距还在持续扩大
更令人震撼的是,全球调用量排名前六的模型全部来自中国:
| 排名 | 模型 | 厂商 | 周调用量 |
|---|---|---|---|
| 1 | Qwen3.6 Plus (free) | 阿里 | 4.6万亿 |
| 2 | MiMo-V2-Pro | 小米 | 3.08万亿 |
| 3 | Qwen3.6 Plus Preview | 阿里 | 1.64万亿 |
| 4 | Step 3.5 Flash (free) | 阶跃星辰 | 1.26万亿 |
| 5 | M2.7 | MiniMax | 1.19万亿 |
| 6 | V3.2 | DeepSeek | 1.19万亿 |
一个关键细节:**这个平台上47%的用户来自美国,中国开发者仅占6%**。也就是说,是美国的开发者在用脚投票,选择了中国的模型。
OpenRouter首席运营官Chris Clark直言:中国模型在美国公司运行的Agent工作流中”占比不成比例地高”。
二、DeepSeek V4:当”价格屠夫”再次出手
4月24日,等了15个月,DeepSeek终于发布了V4预览版。
这一次,DeepSeek不只是做了一个更好的模型,而是做了一个基础设施级别的发布。
1.6万亿参数,百万上下文标配
DeepSeek-V4分为两个版本:
V4-Pro:总参数1.6万亿,激活49B,定位高性能任务
V4-Flash:总参数2840亿,激活13B,主打低成本高吞吐
1.6万亿参数刷新了Kimi 2.6的1万亿规模,成为国产开源模型最大参数规模。但真正重要的是:100万Token的上下文窗口,从Pro版的专属特权变成了所有官方服务的标配。
过去,百万上下文是Google Gemini的独占优势。V4把它打成了”基础配置”。
成本:GPT-5.5的1/32
DeepSeek的定价策略再次让行业震惊:
| 模型 | 输入价格(百万Token) | 输出价格(百万Token) |
|---|---|---|
| DeepSeek V4-Flash | 1元(缓存0.2元) | 2元 |
| DeepSeek V4-Pro | 12元(缓存1元) | 24元 |
| GPT-5.5 | — | 约30美元(≈216元) |
| Claude Opus 4.7 | — | 约75美元(≈540元) |
V4-Flash的输出价格仅为GPT-5.5的1/108,Claude Opus 4.7的1/270。
更关键的是,这还只是过渡价。DeepSeek在技术报告中明确写道:”预计下半年昇腾950超节点批量上市后,Pro版价格会大幅下调。”
技术突破:稀疏注意力革命
V4的核心技术创新在于注意力机制的重构:
CSA压缩稀疏注意力:每4个Token的KV缓存合并为一条摘要,每个query只挑最相关的top-k条计算注意力
HCA重压缩注意力:每128个Token合并为一条,对剩余摘要做稠密注意力
两种机制交替叠用,形成”粗粒度+细粒度、稀疏+稠密”的组合方案
效果:在1M Token上下文设置下,V4-Pro的单Token推理FLOPs只有V3.2的**27%,KV Cache只有10%**。
这不是简单的参数堆叠,而是一次”参数规模、激活效率、上下文长度”三者的重新平衡。
国产算力验证
技术报告中最值得关注的一句话是:**”我们在英伟达GPU和华为昇腾NPU两个平台上均验证了细粒度EP方案。”**
这是DeepSeek首次在正式技术文档中将华为昇腾与英伟达并列写入硬件验证清单。V4的MoE专家权重和稀疏注意力索引器都采用FP4精度,恰好是华为昇腾950PR芯片的原生支持精度。
DeepSeek正在给自己留出第二条路——CUDA不再是唯一选择。
三、Qwen3.6 Plus:编程能力最强的国产模型
4月2日,阿里千问发布Qwen3.6-Plus,被定位为”当下中国编程能力最强的模型”。
从发布节奏看,千问3.5于2月发布,不足一个半月Qwen3.6即告问世,折射出国产大模型迭代加速进入白热化阶段。
性能匹敌Claude Opus 4.5
Qwen3.6-Plus的核心突破集中在两个维度:
编程能力:在SWE-bench真实编程任务、Terminal-Bench 2.0终端编程、NL2Repo长程编程任务中,表现与Claude Opus 4.5全面匹敌
Agent能力:可自主拆解前端网页开发、仓库级复杂任务,完成”测试—修改—交付”的全闭环工作流
更值得关注的是,它支持100万Token的上下文窗口,可基于界面截图、设计稿直接生成代码,打通”看懂界面—生成代码—调用工具完成修改”的完整链路。
登顶全球调用量榜首
Qwen3.6 Plus发布后迅速引爆开发者社区。在OpenRouter平台上,它以4.6万亿Token的周调用量位居全球第一,创下单模型周调用量历史纪录。
阿里千问3.6系列在发布一周内即强势占据两席(Qwen3.6 Plus和Preview版本),折射出新模型在全球开发者社区的热度之高。
根据弗若斯特沙利文报告,在中国大模型B端市场,千问系列的日均Token调用量占比32.1%位列第一,领先字节豆包(21.3%)和DeepSeek(18.4%)。
四、MiniMax M2.7:AI开始”自我进化”
如果说DeepSeek V4和Qwen3.6 Plus代表了性能和价格的极致,那么MiniMax M2.7则打开了一扇全新的门。
首个自我进化的AI模型
M2.7最革命性的突破在于:它是业界首个AI深度参与迭代自己模型的系统。
M2.7能够:
自行构建复杂的智能体控制框架(AgentHarness)
基于复杂技能(Skills)、工具检索工具(ToolSearchtool)等能力,完成高度复杂的生产力任务
自动收集反馈、构建评估集,持续优化自身架构、技能和记忆机制
在优化编程能力时,M2.7可以自主运行超100轮循环,最终实现30%性能提升。
开源首日全生态适配
M2.7开源首日,华为昇腾、摩尔线程、沐曦、崑崙芯、NVIDIA、TogetherAI、Fireworks、Ollama等海内外芯片厂商及推理平台即完成模型接入与推理适配。
在SWE-Pro基准测试中得分56.22%,接近GPT-5.3-Codex水平。
五、Token经济学:从”问答工具”到”生产力燃料”
Token调用量的爆发式增长,背后是一场使用模式的根本转变。
编程类任务占比超50%
根据OpenRouter与a16z联合发布的百万亿Token实证研究报告:
编程类任务从2024年初占总用量的11%跃升至超过50%
Agent驱动的自动化工作流产生了平台上过半的输出Token
大量调用AI的使用者,并非普通终端用户,而是专业开发者和行业专家
AI的角色正在从一个提供简单信息的”问答工具”,进化为能够深度参与工作流的”生产力工具”。
“Token通胀”概念
国联民生证券提出了”Token通胀”这一概念——不是Token变贵,而是单位时间内、单位用户的Token消耗结构性上升。三大趋势驱动:
**从”问答”到”干活”**:编程场景天然具有”长上下文、多轮迭代、大量输出”的特征
Agent技术兴起:Agent主动规划、检索、执行、反思,多次调用模型
推理强度上升:深度思考、长链路推理显著提高Token消耗
Token不是传统互联网时代边际成本几乎为零的”流量”,而是执行生产任务时必不可少的”燃料”。
六、为什么是中国?
中国大模型的崛起并非偶然,而是多重因素协同作用的结果。
1. 技术路线:MoE架构的红利
以DeepSeek、Qwen为代表的中国模型广泛采用MoE(混合专家)架构。门控网络智能判断任务性质,只激活一小部分最相关的专家网络参与计算。
这种”按需激活”模式,可以让推理时的显存占用降低60%,推理吞吐量提升19倍。
2. 成本优势:1/30的价格
MiniMax M2.5的输出价格为1.1美元/百万Token,Claude Opus 4.6为25美元——差距22.7倍。
全球开发者在成本敏感的自动化场景中做出了理性的价格选择。
3. 垂直整合:从芯片到应用
以阿里”通义-云-芯”体系为代表,中国AI厂商正在探索模型算法、云计算基础设施、AI芯片的深度协同设计。
4. 应用场景爆发
字节跳动旗下豆包大模型日均Token使用量已突破120万亿——一家公司贡献了全国总量的绝大部分。
AI视频创作(Seedance 2.0)、AI漫剧、AI编程等消费级内容场景率先引爆规模。
七、冷思考:崛起之下的隐忧
起步差距仍然存在
DeepSeek在技术报告中坦承:V4在复杂指令遵循、格式美观、极端摘要等方面仍有提升空间。总体约落后前沿闭源模型3-6个月。
人才流失压力
DeepSeek核心研发团队约100多人,已有5位核心技术大牛流向字节、腾讯、小米等公司。对一家不到200人的公司来说,这类流动影响深远。
商业化挑战
开源路线意味着更薄的利润空间。OpenAI、Anthropic可以通过订阅、API、企业服务建立商业闭环;DeepSeek没有这些现成的商业缓冲层。
Token不等于创新
中欧国际工商学院杨蔚副教授提醒:Token消耗量不等于AI转型的成效。古德哈特定律告诉我们——当一个度量标准变成目标,它就不再是好的度量标准。
结语
2026年的春天,中国大模型完成了一次历史性的跨越。
从调用量超越美国,到DeepSeek V4把价格打到地板,从Qwen3.6 Plus登顶全球编程榜,到MiniMax M2.7开启”自我进化”时代——这不是一家公司的胜利,而是一个生态的崛起。
黄仁勋说:”没有算力,就无法生成Token;没有Token,就无法带来收入增长。”
而中国的回答是:用1/30的成本,生成同样甚至更好的Token。
潮水的方向已经改变。接下来的问题是——当中国模型越来越强、越来越便宜,全球AI的竞争格局会走向何方?
相关链接
OpenRouter全球大模型调用量数据[1]
DeepSeek V4技术报告[2]
阿里千问Qwen3.6发布[3]
MiniMax M2.7开源[4]
OpenRouter & a16z 百万亿Token实证研究[5]
中欧商学院:日均140万亿Token背后的4大趋势[6]
引用链接
[1]OpenRouter全球大模型调用量数据: https://openrouter.ai/rankings
[2]DeepSeek V4技术报告: https://api-docs.deepseek.com/
[3]阿里千问Qwen3.6发布: https://www.aliyun.com/product/tongyi
[4]MiniMax M2.7开源: https://www.minimax.io/news/minimax-m27-en
[5]OpenRouter & a16z 百万亿Token实证研究: https://a16z.com/state-of-ai/
[6]中欧商学院:日均140万亿Token背后的4大趋势: https://cn.ceibs.edu/new-papers-columns/28895