中国大模型的收入兑现速度,正在超出华尔街此前的预判。
8月3日,高盛亚太互联网团队分析师Ronald Keung在最新研报中将中国大模型厂商2026年末合计ARR(年度经常性收入)预期从100亿美元上调至130亿美元,并预测2030年将攀升至1250亿美元——五年25倍。同日,Jefferies最新研报中用更密实的数据刻画了另一条暗线:OpenRouter平台上,中国模型已连续14周包揽调用量前五,DeepSeek V4 Flash单周消耗7.22万亿token登顶全球。
一条线是收入预期的上调,一条线是token消费的结构性爆发。二者交汇之处,正是中国大模型从“性价比叙事”迈入“收入兑现叙事”的拐点——而驱动这一拐点的核心力量,正是Agent与编码场景对token消费模式的根本性重塑。
叙事切换:收入兑现时刻已到来
高盛预测,中国大模型的API及订阅收入将从2026年估算的350亿元人民币增长至2030年的8790亿元,对应每日token消耗量从350万亿增至4600万亿。这意味着,五年间收入与token消耗量同增约25倍,且增速仍在加速而非递减。
更关键的是收入结构的分化。高盛对智谱和MiniMax的收入估计分别上调了35%和22%—64%,反映出市场对中国头部模型公司商业化能力的重新定价。高盛将中国AI模型市场描述为正在形成的“双层结构”:高端市场以智谱GLM5.2和阿里Qwen3.7 Max为代表,定价约每百万token 1美元;低端市场面向Agent任务的模型定价低至每百万token 0.06至0.2美元。两层市场均在快速扩张,但驱动因素截然不同——高端靠智能溢价,低端靠规模效应。
不过,高盛也坦承现实约束:2026年行业训练总成本40亿美元、推理总成本70亿美元,合计高于当期ARR,板块整体仍处于负EBIT状态。API业务毛利率当前仅20%—30%,盈利拐点要到2030年才会出现,届时板块EBIT利润率可达18%,对应总利润230亿美元。换言之,这是一条“先烧钱、后兑现”的路径,但终点已被清晰标定。

极致性价比:4到8倍的价差
性价比不是新话题,但价差的量级仍令人咋舌。
高盛算过一笔账:一名Agent开发者每日约消耗709万token,在美国顶尖模型上运行,单日算力“燃料费”为52至104美元;切换至中国头部模型后,成本骤降至13美元。4到8倍的价差,使得“不使用中国模型”变成了一项需要向CFO作出合理解释的商业决策。
价差的底层是架构红利。中国模型普遍采用MoE(混合专家)架构,通过极低的参数激活比压低推理成本。以DeepSeek V4 Flash为例,输入价格仅为每百万token 0.14美元,输出0.28美元——而OpenAI GPT-5.5的报价是5美元,差距在35倍以上。更关键的是DeepSeek的缓存命中折扣机制:命中缓存只按标价2%计费,远超业内普遍的90%折扣水平。这意味着,对于Agent场景中大量重复性的上下文读取,实际成本还能再降一个数量级。
但价格只是硬币的一面。真正让华尔街重新评估的,是中国模型在能力维度上的快速跃迁”。中国AI性价比的真正含义正在被重写:它早已突破了"便宜但凑合"的旧标签,转而代表着"足够好且不可不用"的新标准。

不只是便宜:能力超越的临界时刻
高盛将中国大模型的发展划分为两个阶段:2025年是“DeepSeek时刻”,行业依托MoE架构大幅压低推理成本,核心优势落在成本效率;2026年是“智谱时刻”,GLM 5.2跻身代码、智能体等高价值赛道全球第一梯队,证明国产模型性能具备全球竞争力。前者降低了成本,后者证明了能力。
这并非投行的溢美之词。三个月内,中国大模型跻身全球文本赛道前50%的模型新增13款;代码赛道全球前30%新增5款;智能体赛道实现从零到一的突破,GLM-5.2稳居全球前7。在Artificial Analysis视频模型榜单中,MiniMax H3的视频编辑能力排名全球第一,字节Seedance在多模态生成领域同样处于领先梯队。斯坦福AI Index数据显示,中美顶尖模型性能差距已缩小至约2.7%——这个数字在一年前还是两位数。
能力超越的核心在于:中国模型的架构创新并非以牺牲性能为代价换取低成本。恰恰相反,MoE架构的稀疏激活机制在压低推理成本的同时,通过更大的总参数量实现了更高的模型容量。MiniMax在M3模型中推出的全新注意力架构MSA(混合稀疏注意力),将1M超长上下文的处理成本降至传统架构的极低水平,同时在Coding和Agent基准测试中跻身全球前列。美团LongCat 2.0基于5万张国产算力卡完成1.6万亿参数全量训练,证明国产软硬件协同栈不仅能跑通,还能跑出竞争力。
更关键的是,能力超越正在从“通用基准”向“高价值场景”渗透。高盛的评估显示,在基础文本模型领域,智谱和DeepSeek表现最突出;在Agent工具调用和Coding场景中,阿里Qwen3-Max处于全球第一梯队。当中国模型不再只有在“性价比赛道”上领先,同时在智能体、编码、多模态生成等最考验模型深度理解与长程规划能力的赛道上与全球顶尖模型正面竞争时,“便宜”就不再是唯一的故事——“更好”正在成为新的叙事。
这也解释了为什么OpenRouter上的token消费不只是“贪便宜”的产物。当Agent开发者需要模型在数百次工具调用中保持指令遵循、长上下文记忆和错误恢复能力时,纯粹的价格优势不足以支撑持续使用——模型必须“足够聪明且足够便宜”,二者缺一不可。中国模型正在同时满足这两个条件,这才是竞争态势被改写的根本原因。


Token消费的结构性转向:从“Chat”到“Work”
如果说收入预期上调是“果”,那么token消费模式的转变就是“因”。
OpenRouter最新周报(7月27日—8月2日)显示,全球大模型调用量前五全部由中国模型包揽:DeepSeek V4 Flash(7.22万亿)、小米MiMo-V2.5(6.3万亿)、腾讯混元Hy3(4.82万亿)、DeepSeek V4 Pro(3.28万亿)、智谱GLM5.2(2.89万亿)。中国模型在全球平台的token份额已达63.5%,美国跌至35.5%。
但比排名更重要的是消费结构的质变。一个关键数据:同一份编码任务,AI Agent自动化工作流平均消耗417万token,普通代码问答仅消耗3390token——相差超过1000倍。原因在于,Agent需要不断读取上下文、调用工具并循环规划。真正昂贵的不是回答问题,而是让AI持续工作。
OpenCode平台披露,DeepSeek V4 Flash单日处理量已达8万亿token,其中5万亿来自免费试用额度,3万亿来自付费套餐。这种“免费拉新+付费转化”的路径,直观反映了Agent生态正在快速扩张。更值得关注的是,以Hermes为代表的Agent应用已经超过人类聊天,成为OpenRouter上最大的token消耗App。
“Token的主人正在换人”——过去三年,token是人买的、人看的;从今年开始,越来越多的token,人都不会看一眼——那是Agent在规划、调用工具、写代码、自我检查时,机器烧给机器的。这种转变不仅改变了需求的计算方式,也重塑了模型竞争的核心维度:衡量一款模型的单位,从“单次回答有多聪明”变成了“完成一项长任务要花多少钱、多久、失败几次”。
这种转变也催生了“多模型调用”的新范式。微软已证实正在探索将DeepSeek V4部署在Azure上,用作Copilot的低成本模型选项;Airbnb CEO公开表示公司依赖阿里Qwen模型用于大规模生产场景。企业客户正在从“绑定单一模型”转向“便宜的和高级的搭配着来”——这种混用正在从个别企业的权宜之计,变成默认配置。


多模态与Agent:竞争新前沿
当token消费从“Chat”转向“Work”,竞争的前沿也在迁移。
7月31日,MiniMax发布新一代多模态生成模型H3,并宣布近期开源。这是MiniMax推出的首款开源多模态生成模型,支持文本、图片、音频和视频等多种输入,可直出2K分辨率画面,最长生成15秒音画内容。在Artificial Analysis视频模型榜单中,H3的视频编辑能力排名全球第一。
更具冲击力的是定价:H3视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰模型的三分之一。成本下降来自两个方向的技术优化——高压缩Tokenizer减少了视频生成所需的token数量,异构训练和GPU利用效率的系统性调优则控制了训练与推理成本。MiniMax股价当日大涨超14%,市场对“极致性价比+开源”的商业突围路径投下了赞成票。
在Agent应用层,竞争同样白热化。字节跳动发布面向Agent与Coding场景的Seed 2.1 Pro,具备复杂任务编排、长程规划和工具调用能力;腾讯WorkBuddy在企业Agent应用市场占据34%的份额;智谱GLM Coding Plan同步开放订阅,1GW级国产AI算力数据中心落地。编码场景已成为模型厂商必争之地——因为编码是Agent能力最直接的商业化出口,也是token消耗最密集的场景之一。
高盛注意到,AI消耗token最多的两大应用——智能代理和编程——已大规模迁移至中国模型上运行。这不是因为中国模型品质超越了美国,而是因为其极低的单价使得规模化部署在经济上变得可行。当Agent任务需要调用上百次模型才能完成时,4到8倍的价差会被放大成数百倍的账单差异。

CSP财报前瞻:云收入加速兑现
模型层的繁荣正在向云收入层传导。
阿里云最新季度收入达398.24亿元,同比增长34%,增速创三年新高。AI相关产品收入连续第九个季度实现三位数增长,AI相关服务贡献了云业务对外收入的约20%。高盛预计,阿里云AI收入占比将从30%向50%迈进,推动整体云收入增速持续加速。
过去四个季度,阿里在AI+云基础设施的资本开支约1200亿元。阿里巴巴CEO吴泳铭在财报电话会上明确表示:“三年规划3800亿的投资目前看说少了。”阿里云AI服务器上架节奏跟不上客户订单增长速度,在手积压订单持续扩大。供应链端FAB、存储、CPU均处于紧缺状态,连3到5年前的老一代GPU都满载运行。
Jefferies在研报中前瞻了即将到来的CSP财报季:阿里云收入预计加速至45% YoY,腾讯云AI收入占比持续提升,百度智能云受益于文心系列模型迭代。云厂商正在从“卖算力”升级为“卖AI能力”——这种转变意味着收入结构从线性的资源租赁,转向更具弹性的MaaS+IaaS混合模式,毛利率天花板也将被打开。

中国大模型正在经历一场双重转型
第一重,从“性价比”到“收入兑现”。高盛将ARR预期从100亿上调至130亿美元,不是因为它突然变得乐观,而是因为token消费的数据已经跑出来了——7.22万亿的周调用量不是预测,而是正在发生的现实。当中国模型连续14周包揽OpenRouter前五,当Agent开发者每天烧掉8万亿token,收入预期的上调只是对既有趋势的滞后确认。
第二重,从“Chat”到“Work”。token消费的主人正在从人变成Agent,这不仅是量的爆发,更是质的转变。Agent任务的token消耗是普通问答的1000倍,而中国模型4到8倍的价格优势在这种量级下被放大成不可逾越的成本壁垒。微软在Azure上部署DeepSeek、Airbnb依赖Qwen——企业用脚投票的结果,比任何benchmark都更有说服力。
两条线交织的结论很清晰:中国大模型的竞争态势正在被改写。竞争的核心不仅仅是谁的参数更大、谁的benchmark分数更高,谁能把推理成本压到最低、谁能在Agent和编码场景中捕获最多的token消费、谁能将模型能力最快地转化为云收入。这是一场关于成本、场景和生态的综合博弈——而中国模型,正在从“跟跑者”变为“规则制定者”。
本文来自华尔街见闻,欢迎下载APP查看更多
原文:toutiao.com/article/7670366929055449610/
声明:该文仅代表作者本人观点