模型与智能前沿

从推理时计算、开放模型、价格下降到生产可靠性,判断模型层真正的护城河。

第 2.1 章|模型与智能前沿

模型能力仍在快速提高,但“最强模型”已经不再是一条稳定的护城河。真正的竞争逐渐转向推理成本、产品分发、开发者生态与生产可靠性。

从参数扩张转向推理时计算

上一阶段的主线是预训练规模:更多数据、更大模型、更多 GPU。边际收益下降后,行业没有停止扩大算力,而是把算力移到使用时。推理模型通过更长的思考链、多次采样、工具调用和自我校验,提高复杂任务的成功率。训练是一笔集中发生的成本,推理则在每次使用时重复发生,因此单位查询消耗可以上升,调用总量也同步扩大。

这改变了模型层的经济学。能力进步继续支撑需求,但训练领先不再自动转化为利润。用户可以在不同任务间切换模型,开发者也会用路由器按质量、延迟与价格动态选择。模型公司必须靠产品、渠道、数据闭环和企业集成把能力变成黏性。

榜单为什么越来越难读

许多旧基准已接近饱和,新基准又会迅速被追上。榜单上的第一名经常随模型版本、提示词、测试框架和是否允许工具调用而变化。对投资者而言,单一分数只能说明短期技术位置,不能证明商业优势。

更有用的是把竞争拆成三张榜:

维度应关注什么商业含义
通用能力综合推理、多模态、长上下文决定品牌和高端定价上限
编码与智能体真实代码库任务、工具使用、长任务成功率最接近可量化的企业回报
成本与速度固定能力下的每百万 token 价格、延迟、吞吐决定大规模生产采用

截至观察日,Claude 系列在若干通用与高难度评测中领先,GPT-5 系列在自主编码上表现突出;但差距很小、迭代很快,不应被理解为长期排序。

主要模型阵营

模型家族公司市场位置投资入口
GPT-5 系列OpenAI消费者默认入口、编码与工具生态强私营;Microsoft 间接敞口
ClaudeAnthropic企业与编码领先,强调安全和可靠性私营;Amazon、Google 间接敞口
Gemini 3Google DeepMind多模态、搜索与 Workspace 分发GOOGL
Grok 4xAI实时信息与 X 平台分发私营
Llama 4Meta开放权重生态的重要推动者META
DeepSeek V/R 系列深度求索低成本、高效率、开放权重私营
Qwen 3阿里巴巴中国开发者覆盖广、开放模型下载量高BABA / 9988.HK
Kimi、GLM月之暗面、智谱长上下文、企业与开发者市场私营
文心、混元、豆包百度、腾讯、字节跳动依靠搜索、社交与内容平台分发BIDU / 0700.HK / 私营

表中的“领先”指产品和生态位置,不等于稳定利润。模型公司通常同时面对巨额训练成本、推理补贴和快速降价。

中国开放模型正在改变开发者市场

企业模型使用份额

美国公司把最强模型放在封闭 API 和订阅产品中,中国厂商则更积极地发布开放权重。这个差异并非简单的技术路线选择,而是商业约束的结果:在高端芯片受限、国内消费者付费意愿较弱的环境中,低成本和开放分发更容易换取开发者规模。

DeepSeek 的意义不只是一次榜单冲击。它向全球开发者证明,接近前沿的能力可以用更低推理价格和更开放的部署方式获得。Qwen、Kimi、GLM 等家族随后加速迭代,使企业在私有部署、主权数据和成本敏感场景中拥有更多选择。

开发者路由平台上的模型使用变化

这会压低模型层利润,却扩大下层基础设施需求:更多模型、更低价格和更广部署,意味着更多推理量。中国模型的开放扩散,也让“美国闭源前沿、中国开放规模”成为值得持续观察的结构性分工。

智能价格正在快速下跌

不同模型的价格差距

同等能力的推理成本每年都在明显下降,原因包括模型压缩、量化、推测解码、硬件升级和竞争降价。价格下降会产生两种相反效果:

因此,“推理价格下跌”不是简单利空算力。关键要看需求弹性:如果调用量增长快于单价下降,总收入和总算力需求仍会上升;如果企业只把降价用于压低现有账单,基础设施增速就会放缓。

收入、估值与资本消耗

主要私营模型公司的收入规模

头部实验室的收入增速很快,但现金消耗同样惊人。收入来自消费者订阅、企业 API、编码工具和与云厂商的分成;成本则集中在训练、推理、人才和数据中心承诺。高私募估值往往隐含三个假设:能力继续领先、分发持续扩大、推理毛利能够改善。任何一个假设失效,估值都会比收入更快调整。

对上市市场而言,Microsoft、Amazon 和 Google 提供间接敞口,但这些投资对母公司利润的影响不同。Google 拥有模型、TPU、云和分发的完整闭环;Microsoft 依靠 Azure 与企业软件;Amazon 的优势更多来自云基础设施。间接持股不应被当作对私营实验室的一比一替代。

智能体:能力进步快,可靠性进步慢

编码是智能体最先跑通的场景,因为结果可测试、过程可回滚、价值可量化。进入客服、财务、医疗和法律后,错误成本、权限、合规和系统集成迅速成为主要限制。演示中完成一次任务,与生产环境中连续数万次正确执行,是两种完全不同的能力。

判断智能体是否真正进入生产,应看四个指标:试点转生产率、无人干预完成率、错误和升级率、客户续约后的利润变化。只看模型基准或“已部署智能体数量”,很容易把实验活动误当成经济价值。

投资判断:买分发与成本曲线,不买一时榜首

模型层最值得拥有的不是某次评测冠军,而是能够把能力稳定送到用户手中的渠道,以及在价格战中仍能保住单位经济性的成本结构。观察重点包括:

本章逻辑的反证是:能力差距重新扩大并稳定维持,或专有数据与产品闭环形成明显锁定。若相反地,开放模型持续追平、路由器普及、价格继续快速下降,模型会越来越像可替换的输入,价值将向应用分发和物理基础设施迁移。


主要参考:OpenAI 使用规模披露Artificial AnalysisOpenRouter 模型市场及相关公司公开资料。榜单和价格变化很快,应按实时数据重新核对。