模型与智能前沿

解释模型更强、更便宜之后,为什么算力需求上升,模型公司护城河却未必更深。

第 2.1 章|模型与智能前沿

模型能力越强、价格越低,AI 的市场当然可能越大;但这并不等于模型公司的利润会同样变大。投资者真正要判断的,是更便宜的智能能否带来更快的使用增长,以及哪家公司能把一时领先变成不容易流失的客户、收入和现金流。

如果把整条 AI 产业链看成一座向上输送价值的工厂,那么模型就是这座工厂最终要交付的“智能”。后面章节讨论的 GPU、HBM、先进封装、交换机、液冷、电网和融资,归根结底都在为模型的训练和使用服务。因此,理解模型层不能只看谁在排行榜上第一,还要先弄清一笔钱究竟怎样发生。

模型消耗算力有两个完全不同的阶段。预训练像建造一座工厂:公司集中购买大量算力,让模型一次性阅读海量文本、代码和图像,把规律写进数以十亿计的参数中。推理则像工厂每天开机生产:用户每问一个问题,模型都要重新调用算力,一个 token 接一个 token 地生成答案。训练成本主要在模型发布前发生;推理成本却会随着每一次使用不断重复。

这个区别很重要。假如 AI 主要依赖更大的预训练,赢家更可能是能筹集最多资本、买到最多 GPU 的少数实验室;假如能力进步越来越依赖“回答时多想一会儿”,成本和竞争就会转向推理效率、产品分发和真实使用量。过去两年的变化,正是从第一种商业模式走向第二种商业模式。

从一个普通问题开始:为什么回答越来越好,也越来越贵

用户在聊天框里输入一句“帮我检查这份合同”,看到的只是几秒钟后的答案。后台发生的事情却可能远比一次搜索复杂:模型先识别合同结构,逐段阅读上下文,反复检查条款,调用检索或计算工具,对不确定部分重新推理,最后才组织答案。简单聊天也许只生成几百个 token;复杂的编码、研究或智能体任务,可能在用户看不见的地方消耗数十倍乃至上百倍的中间 token。

这就是“推理时计算”。它把模型的思考时间换成回答质量。预训练的边际收益变慢后,前沿实验室并没有停止增加计算,而是把更多计算移到了每一次使用中。Epoch AI 的统计显示,主要供应商的推理在 2025 年初已经占总计算量的一半以上;在复杂推理、智能体和多模态任务中,比例还会更高。对投资者而言,这解释了一个看似矛盾的现象:模型在压缩、量化和硬件升级后变得更高效,数据中心的总算力需求却仍在增加。

原因并不神秘。假设一种模型完成同样任务的成本下降 80%,但降价让十倍用户开始使用,同时每个用户把它从问答工具升级为可以持续工作的智能体,那么总计算量仍会大幅上升。反过来,如果价格下降只是让原有客户的账单减少,而没有创造新工作流,基础设施需求就会减速。模型层最重要的变量不是单位成本,而是需求对降价的反应,也就是需求弹性。

因此,“模型更高效”不能被简单理解为 GPU 利空;“调用量增长”也不能直接被理解为模型公司利好。前者还要看使用量是否增长得更快,后者还要看模型供应商有没有定价权,还是只能把效率收益全部让给客户。

模型进步为什么没有自动变成护城河

过去,最强模型往往同时拥有品牌、用户和定价权。现在,领先位置会随着新版本、提示方式、工具框架和评测方法迅速变化。一个模型可能在数学题上领先,另一个在代码库修改上更可靠,第三个则因为速度和价格更适合大规模部署。企业也不再必须把所有任务交给同一家供应商,而可以用“路由器”按任务自动选择模型。

这形成模型层最重要的矛盾:智能供给越来越丰富,但能够留在某一家公司的利润不一定同步增加。

基础模型能力提高、价格下降,会降低下游产品的开发成本;但当多家供应商都能提供接近的质量,客户也更容易压价和切换。模型公司要保住利润,必须在模型之外建立控制点:

所以,评测冠军只是获得客户注意力的门票,不是利润护城河。真正的护城河来自“换掉它会不会很麻烦”,以及“换掉以后客户会不会损失收入、效率或数据”。

老排行榜正在失效,投资者需要看三张榜

模型能力仍在快速进步,但许多传统基准已经接近满分。当所有头部模型在某项考试中都达到九成左右时,这项考试只能证明它们都很强,不能告诉投资者谁能赚钱。行业因此不断发明更难的测试:真实代码库修改、终端操作、长时间工具调用、专家级综合考试和抽象推理。

新测试也有局限。模型厂商可能针对公开题库优化,代理框架和提示词会显著改变成绩,聚合网站的数据口径也未必一致。更现实的问题是,榜单变化的速度远快于财报。今天领先的版本,可能在下一个季度已经被替代。

与其问“哪个模型最好”,不如同时看三张榜:

观察维度应该看什么它回答的商业问题
能力榜综合推理、多模态、长上下文、高难度任务谁能建立前沿品牌,并获得高端客户的首次试用
付费榜企业 API 支出、续约、生产调用、编码市场份额谁真正进入了企业预算,而不只是赢得媒体关注
分发榜消费者活跃用户、开发者使用量、办公与搜索入口谁拥有低成本获客和交叉销售能力

截至本书观察日,Claude 系列在若干通用与高难度评测中处于前列,GPT-5 系列在自主编码任务上表现突出。可是,能力榜并没有给出一个永久冠军。更有解释力的是另外两张榜:Menlo Ventures 的 2025 年企业调查估计,Anthropic 占企业大模型 API 支出的 40%,OpenAI 为 27%,Google 为 21%;三家合计占 88%。在编码场景中,Anthropic 的份额更高。与此同时,OpenAI 披露 ChatGPT 在 2026 年 2 月已超过 9 亿周活跃用户,消费者入口仍明显领先。12

企业模型使用份额

这三张榜拼起来,才是一幅接近商业现实的图:OpenAI 掌握最强的消费者心智和入口,Anthropic 更深入企业与编码工作流,Google 则能通过搜索、Workspace、云和自研 TPU 把模型嵌入已有业务。它们都可能成为大公司,但理由不同;没有一家可以仅凭“模型最好”获得永久胜利。

主要模型阵营也因此应该按控制点来理解,而不是按一次发布会排序:

模型家族公司真正控制点上市投资入口
GPT-5 系列OpenAI消费者入口、开发者品牌、编码与工具生态私营;Microsoft 为间接敞口
ClaudeAnthropic企业与编码工作流、可靠性定位私营;Amazon、Google 为间接敞口
Gemini 3Google DeepMind搜索、Workspace、TPU、云与多模态GOOGL
Grok 4xAI实时信息与 X 的分发私营
Llama 4Meta开放权重与全球开发者分发META
DeepSeek V/R深度求索低成本效率与开放部署私营
Qwen 3阿里巴巴中国开发者、云生态和开源衍生模型BABA / 9988.HK
Kimi、GLM月之暗面、智谱长上下文、开放模型与企业市场私营
文心、混元、豆包百度、腾讯、字节跳动搜索、社交、内容和超级应用入口BIDU / 0700.HK / 私营

上市公司带来的只是间接敞口。Microsoft、Amazon 和 Google 对模型公司的投资,不等于其股东按同样比例拥有实验室价值。投资回报还要经过云收入、推理成本、资本开支、合作协议和母公司其他业务的稀释。把“某公司投资了头部实验室”直接等同于“买到了模型层增长”,是这一领域常见的估值错误。

开放模型如何把价格竞争推向全球

美国头部实验室通常把最强能力放在封闭 API 和订阅产品中;中国厂商则更积极地发布开放权重。开放权重并不一定意味着完全开源,但企业可以把模型下载到自己的服务器上运行、微调和审计,不必把所有数据发送给外部 API。

这对受监管行业、主权机构和成本敏感客户很有吸引力。它也改变了竞争方式:封闭模型按 token 收费,开放模型则可以被云厂商、软件公司或企业内部团队自行部署。客户仍要支付芯片、电力和运维成本,却减少了对单一模型供应商的依赖。

开发者路由平台上的模型使用变化

DeepSeek 的意义不只是一轮榜单变化。它向全球开发者证明,接近前沿的能力可能以更低价格、更开放的方式获得。Qwen、Kimi、GLM 等随后加速迭代,让企业在私有部署、数据主权和成本敏感场景中拥有更多选择。OpenRouter 这类模型路由平台上的使用数据虽然不是整个市场,但提供了一个有价值的开发者样本:到 2026 年中,中国来源模型的 token 份额已经显著上升,开放模型的使用也超过封闭模型。精确份额会随平台和时间变化,方向却与下载量和衍生模型数量相互印证。3

中国厂商选择开放,并不只是技术理念。高端芯片受限、国内 API 付费能力较弱时,用低成本和开放分发换取开发者规模,是一种主动的非对称竞争。它可以削弱美国封闭模型的定价权,也能让中国模型成为更多本地应用的默认底座。

但开放路线同样不是免费午餐。训练前沿模型需要巨额投入;如果没有云服务、企业产品或其他业务回收成本,开发者影响力未必能转化为利润。部分厂商也可能在建立生态后收紧旗舰模型。投资者要把“开放模型份额扩大”和“开放模型厂商赚到钱”分开判断。

价格下降之后,谁承担成本,谁拿走好处

不同模型的价格差距

模型推理价格下降的速度非常快。Stanford AI Index 估计,从 2022 年末到 2024 年末,达到 GPT-3.5 级别能力的每百万 token 推理成本从约 20 美元降至约 0.07 美元,下降超过 280 倍。Epoch AI 对不同能力里程碑的研究同样发现,固定能力所需的价格在快速下降,但也提醒最近的极端降幅未必能够永久维持。45

价格下降来自多条路径:芯片每代提供更多计算;量化让更少位数表示相近能力;蒸馏用大模型训练小模型;推测解码减少等待;模型路由把简单问题交给便宜模型;竞争者还会主动降价争夺开发者。结果是,同一类任务在不同供应商之间可能出现数倍甚至数十倍的价差。

这时,利润如何迁移取决于三个角色:

  1. 模型公司。 如果它降低成本的速度快于降价,毛利可以改善;如果客户能轻松切换,成本节省会被竞争迫使让出去。
  2. 应用公司。 更低模型成本让更多工作流达到正回报,也给应用层留下更大毛利空间;前提是应用自己拥有客户和产品差异。
  3. 基础设施公司。 如果降价引发的调用增长超过效率提升,GPU、网络、内存和电力需求继续增长;否则硬件订单最终会感受到通缩。

用一个简化例子就能看清:一家客服软件公司原来每处理一张工单要支付 1 元模型费,每月处理 100 万张,模型账单是 100 万元。模型费降到 0.2 元后,如果工单量仍是 100 万张,供应商收入会下降;如果更低成本让公司把 AI 扩大到语音、销售和售后,每月处理 1,000 万次,账单反而增至 200 万元。模型供应商能否受益,取决于它是否仍是这 1,000 万次调用的首选;基础设施能否受益,则取决于每次调用背后实际消耗的总计算量。

因此,降价本身没有明确的投资含义,需要同时观察 API 单价、生产调用量和推理毛利。只有调用量长期快于价格下降,而且单位经济性没有恶化,模型层才能把技术扩散转化为股东价值。

收入增长很快,但必须跑赢资本消耗

主要私营模型公司的收入规模

头部实验室的收入增长证明市场不是虚构的,巨额现金消耗又说明商业模式尚未完成验证。消费者订阅、企业 API 和编码工具产生收入;训练、推理补贴、人才和长期算力合同则持续消耗现金。收入和成本都以少见的速度增长,单看其中一边都会得出错误结论。

OpenAI 在消费者端形成了规模巨大的入口,Anthropic 则用 Claude Code 展示了模型如何进入高价值工作流。编码之所以率先商业化,不是因为程序员更喜欢新技术,而是因为代码天然可验证:程序能否运行、测试能否通过、修改能否回滚,都可以被测量。客户也容易计算回报——同样团队完成更多功能,或者把修复时间从几天缩短到几小时。

这类收入的质量高于一次性试点,因为它会随着开发者每天工作持续发生。可是,投资者仍需要问:增长来自外部付费客户,还是来自合作伙伴补贴?合同是否可取消?推理成本是否随复杂任务快速上升?实验室对云和 GPU 的长期承诺,是否需要未来多年收入才能偿付?

私募估值尤其不能被当成公开市场市值。融资轮次可能包含清算优先权、特殊条款和稀释保护,交易也不连续。高估值同时押注能力领先、分发扩大、企业采用和推理毛利改善;其中任何一项落后,估值调整都可能快于收入下降。

智能体的分水岭不是演示,而是连续正确

智能体把模型从“回答问题”升级为“完成任务”:它可以读取邮件、调用数据库、修改文件、提交代码或执行采购流程。演示往往令人惊艳,因为模型只需要成功一次;生产环境却要求它在数千、数万次操作中持续正确。

假设一个十步流程中每一步成功率都是 95%,全部十步连续成功的概率只有约 60%。如果任务还涉及付款、医疗、法律或客户数据,偶尔失败也可能无法接受。企业因此需要权限控制、日志、人工复核、回滚和责任边界。这些措施会降低风险,也会增加成本,削弱“完全自动化”的宣传效果。

METR 用模型能够以 50% 成功率完成多长的人类任务来衡量智能体进展,其历史数据表明任务时长能力在快速增长;但 METR 也明确提醒,超长任务的测量仍受样本和评测范围限制。能力进步是真实的,可靠性是否达到无人值守生产标准则是另一回事。6

所以,投资者不应只记录“发布了多少智能体”或“有多少企业在试点”,而应追踪以下分母:

编码已经越过一部分门槛;客服、财务、医疗和法律仍要面对更高错误成本、合规责任与旧系统集成。智能体最终可能成为最重要的 AI 应用形态,但“未来很大”不代表今天的每个智能体项目都能产生回报。

视频、机器人与世界模型会先扩大算力账单

文本不是模型需求的终点。视频生成需要同时处理画面、时间和声音,单位任务的计算量远高于普通文本;世界模型要模拟可交互环境;机器人还要把视觉、语言和动作连续连接。OpenAI、Google、快手、字节跳动和 MiniMax 等在视频方向竞争,NVIDIA、Google DeepMind 以及多家创业公司则把模型扩展到仿真和具身智能。

这些方向对基础设施需求是直接的,对商业回报却仍需验证。生成一段漂亮视频很容易展示,是否能稳定进入广告、影视和设计预算,则要看版权、一致性、编辑控制和单位成本。机器人能够完成一次搬运,不等于它能在真实工厂持续运行并承担安全责任。

Google DeepMind 发布图:机器人在 Gemini Robotics 控制下操作桌面物体
具身智能把模型从文字生成器变成物理控制系统。Google DeepMind 的 Gemini Robotics 发布图把这条新链路呈现出来:感知、语言、规划和动作必须协同,机器人才能从演示走向经济产出。Google DeepMind

新模态通常先增加训练与推理需求,收入随后才到。基础设施公司可能在商业模式完全成熟前就收到订单;模型和应用公司则必须证明客户愿意长期为结果付费。

下一道约束可能不是算力,而是“有用的数据”

高质量人类文本的供给有限,公开互联网也已经被大量用于训练。模型公司因此越来越依赖两种新材料:一是模型自行生成并筛选的合成数据;二是可以给出明确奖励的训练环境,让模型通过反复尝试学习。

这在代码、数学和游戏中更有效,因为答案可以验证:测试通过就是通过,计算正确就是正确。开放式写作和复杂社会判断则没有简单评分器,反复使用模型输出训练还可能放大错误和偏见。于是,能力进步更容易集中在“结果可验证”的领域,这也解释了为什么编码、数学和工具调用进展更快。

围绕强化学习环境、数据标注和自动评测的新供应链正在形成。它可能成为新的“卖铲人”,也可能过早吸引估值。判断标准仍然不是宣布拥有多少数据,而是这些环境能否让模型在真实任务上持续提高,并且客户是否愿意为提高后的结果付费。

谁可能留下利润

模型层的利润大概率不会平均分配。可以用四个问题逐家公司判断:

  1. 客户从哪里来? 是每天主动使用的消费者、已有办公软件用户,还是需要昂贵销售才能获得的企业客户?
  2. 为什么不能切换? 是专有数据、深度集成、可靠性认证,还是仅仅因为当前版本稍强?
  3. 成本是否领先? 公司能否用自研芯片、模型优化和规模降低推理成本,并把一部分节省留在毛利中?
  4. 收入是否偿付资本? 生产调用、续约和现金流,能否覆盖训练、推理和长期数据中心承诺?

Google 的模型、TPU、云、搜索和 Workspace 构成较完整闭环;Microsoft 控制企业软件入口和 Azure;Amazon 控制云基础设施;Meta 用开放分发强化广告与社交生态。OpenAI 和 Anthropic 分别拥有消费者与企业开发者品牌,却仍是私营公司。Alibaba 既有中国云入口,也通过 Qwen 获得开放模型生态,但同时承担中国市场、资本开支与政策风险。

这意味着,对于公开市场投资者,模型层并没有一个干净的“纯粹标的”。更合理的做法是判断 AI 是否改善母公司的整体现金流,而不是只计算它与某家实验室的关系。对大多数独立模型公司而言,收入增长仍然值得重视,但在能够证明持续毛利和资本回报前,不能把技术领先直接资本化为永久垄断。

投资者每个季度应该检查什么

评估模型公司时,应固定检查五组数据:

信号多头真正希望看到的变化需要警惕的变化
生产使用付费调用、续约和单客户扩展持续增长注册用户增长,但生产调用停滞
价格与毛利单价下降,同时推理成本下降更快价格战快于成本改善
客户锁定工作流、数据和权限集成加深模型路由让客户随时切换
资本效率收入和现金毛利快于算力承诺增长长期合同、亏损和融资需求同步扩大
智能体可靠性无人干预完成率提高,人工复核下降试点数量很多,转生产比例很低

真正有价值的信号通常很无聊:API 消费量、毛利、客户留存、合同期限和错误率。最容易传播的信号——排行榜、演示视频和参数规模——反而最容易被下一次发布覆盖。

哪些证据会推翻当前判断

当前判断是:模型能力继续进步,智能价格继续下降,推理需求继续扩大;与此同时,模型的可替代性提高,利润更可能流向拥有分发、工作流、数据和成本优势的公司。

有三类证据会推翻或明显改变这一判断。

第一,预训练重新出现一次明显的规模跃迁。如果单纯把模型做得更大,就能获得竞争者难以追赶的能力差距,那么拥有最多资本和算力的实验室会重新取得更强定价权。

第二,效率冲击大到总用量也无法吸收。如果完成同类任务所需计算再次下降一个数量级,而调用增长没有跟上,GPU、网络、电力和模型收入都会受到通缩影响。

第三,智能体可靠性跨过大规模生产门槛。如果企业开始披露广泛、持续、可审计的利润改善,模型和应用收入会比当前预期更快兑现,整条基础设施建设也将获得更强的现金流支持。

还要观察开放模型策略是否发生逆转。如果主要厂商逐步关闭旗舰权重,封闭模型的定价权可能恢复;如果开放模型继续追平、路由器更加普及,模型会更像可替换的计算原料。

最终,投资者不需要猜中下个月的排行榜冠军。需要回答的只有一句话:当智能越来越便宜、越来越普及时,哪家公司不仅参与了增长,还能让客户留下,并在支付所有算力成本之后留下现金?


第 2.1 章尾注

图表来源

本章图表与关键主张的链接证据:7 3 8

Footnotes

  1. 2025: The State of Generative AI in the Enterprise. Menlo Ventures,2025 年 12 月 19 日。企业调查与自下而上的市场估计,并非发行人审计收入。

  2. Scaling AI for everyone. OpenAI,2026 年 2 月 27 日。公司披露的产品指标。

  3. Chinese AI models gain ground on U.S. rivals as low costs drive adoption. CNBC,2026 年 7 月 7 日;访问于 2026 年 7 月 25 日。 2

  4. Artificial Intelligence Index Report 2025. Stanford HAI,2025 年 4 月 7 日。

  5. LLM inference prices have fallen rapidly but unequally across tasks. Epoch AI,2025 年 3 月 12 日。

  6. Task-Completion Time Horizons of Frontier AI Models. METR,更新于 2026 年 5 月 8 日。

  7. Model pricing snapshot. OpenRouter,访问于 2026 年 7 月 25 日。

  8. AI companies: revenue and valuation data. Epoch AI,2026 年 7 月 21 日;访问于 2026 年 7 月 25 日。