最近在思考一个问题:随着 AI 模型的能力不断提升,它们是否也会逐渐进入一个边际收益递减的阶段?
我的回答是:大体上会。
不过,这个判断需要先限定对象。进入边际收益递减阶段的,主要是普通用户能够感知和获得的增量价值,而不是底层技术已经停止进步。模型从 90 分提高到 92 分,用户未必能够明显感知;但如果响应时间从几十秒缩短到几秒,或者同一项任务的成本下降一个数量级,使用方式却会直接改变。
换句话说,我并不认为大模型已经触及能力上限,而是认为单纯增加模型能力,正在变得越来越难以转化为同等幅度的用户价值和商业差异。
为什么可以说边际收益正在递减
下面几组信号并不能单独证明“模型能力见顶”,但它们共同指向一个趋势:头部模型的能力正在收敛,旧的测量方式正在失效,竞争重点则逐渐转向成本、速度、可靠性和应用入口。
头部模型在用户感知上越来越接近
“现在几个头部模型用起来都差不多”不只是一种个人感受,人类偏好评测里也能看到类似现象。
Stanford 2026 AI Index 的技术能力章节显示,截至 2026 年 3 月,Anthropic、xAI、Google 和 OpenAI 的模型在人类投票驱动的 Arena 榜单上只相差 22 个 Elo 分;在税务、抵押贷款、企业金融和法律推理等专业领域评测中,前 15 名模型之间的差距最小只有 3 个百分点。报告因此直接把竞争压力概括为正在转向成本、可靠性和领域表现。
这并不表示模型完全相同。不同模型仍然有各自擅长的任务,长上下文、代码、写作风格和工具调用也可能存在明显差异。但对于大量日常需求,差异已经小到不足以让普通用户稳定识别。此时,模型再提升几分,很可能不如响应更快、价格更低或者少犯一次低级错误来得明显。
传统 Benchmark 正在失去区分度
“Benchmark 提升越来越小”只说对了一半。
在 MMLU、MATH 等接近饱和的旧评测上,继续提高自然会越来越困难,几个头部模型的分数也会挤在一起。Epoch AI 在其 2025 年影响报告中明确提到,单项 benchmark 饱和后,已经很难用一个分数比较前沿模型,因此他们开始使用聚合多个评测的 Epoch Capabilities Index。
但这不能证明模型的底层能力已经放缓。同一份 Stanford 2026 AI Index也给出了一个反例:前沿模型在 Humanity’s Last Exam 上一年提高了 30 个百分点,原本预计能够使用数年的评测可能在几个月内就被快速追上。更准确的描述不是“所有 Benchmark 的提升都越来越小”,而是:
简单和成熟的 Benchmark 已经接近天花板,新的高难度 Benchmark 又很快被追赶,单个分数越来越难代表真实能力。
这件事反而强化了用户侧的边际收益递减。实验室仍在解决更难的问题,但这些进步未必能立即改变普通人的摘要、搜索、写作和问答体验。
同等能力正在迅速变得更便宜
能力一旦被做出来,就会通过小模型、蒸馏、工程优化和开源生态迅速扩散。Stanford 2025 AI Index显示,达到 GPT-3.5 水平的模型推理价格,在 2022 年 11 月至 2024 年 10 月之间下降了 280 多倍。
Epoch AI 2026 年的跟踪数据则显示,2026 年以来,最强开源权重模型在其综合能力指数上平均只落后最前沿闭源模型约 4 个月。前沿实验室仍然领先,但昨天昂贵而稀缺的能力,很快就会成为今天更便宜、更普遍的能力。
这意味着一项能力首次出现时可能非常重要,等它扩散到多个供应商之后,竞争就会从“有没有”变成“谁更快、更便宜、更稳定”。
基础模型厂商开始亲自争夺应用入口
另一个明显信号是,基础模型厂商已经不满足于只提供 API,而是不断向应用层纵向扩张:
- OpenAI 推出了面向开发者完整工作流的 Codex App,并直言核心挑战已经从模型“能做什么”转向人如何大规模地指导、监督和协作
- Anthropic 将 Claude Code 正式推向应用、IDE 和终端,同时围绕权限、检查点、后台任务和开发流程持续构建产品
- Google 持续扩展 Gemini App,把个性化界面、主动简报和全天运行的 Agent 集成到具体应用中
如果模型能力本身足以长期形成壁垒,最自然的商业模式应当是出售模型能力,让其他公司构建应用。现在几家头部厂商都在亲自争夺编程、办公、搜索和个人助理入口,至少说明它们也认为:价值不会只停留在基础模型这一层,还会集中在用户关系、工作流、上下文和最终交付上。
当然,这仍然不是“模型停止进步”的证明。它也可能只是基础设施公司的正常纵向整合。但从商业行为看,厂商显然正在把更多注意力放到如何使用和交付能力,而不只是继续展示一个更高的模型分数。
发布竞争正在从能力数字转向叙事
当模型在常用评测上的差距缩小时,厂商自然会寻找新的差异化叙事:安全、对齐、Agent、生态、人格、工作方式以及“通往更高级智能的路线图”都会成为发布重点。其中既有真实的技术问题,也有品牌和市场竞争的成分。
因此,把厂商对安全的强调全部称为“炒作”并不公平。模型获得的权限越大,安全就越重要。但安全叙事是否可信,应该看可核查的评测和披露,而不能只看厂商的措辞。
Stanford 2026 AI Index 的负责任 AI 章节提供了一个值得警惕的对照:几乎所有头部厂商都会报告 MMLU、SWE-bench 等能力指标,但负责任 AI 指标的披露仍然稀少;基础模型透明度指数的平均分还从 2024 年的 58 分降到了 2025 年的 40 分。与此同时,模型在常规安全测试中表现不错,在对抗性越狱提示下却普遍退化。
这并不能证明厂商在“假装重视安全”,但至少说明了一点:安全话语的增加不等于可验证安全性的同步增加。当发布会越来越强调宏大风险、安全承诺和未来路线,却减少训练数据、算力和部署影响的具体披露时,我们有理由把其中一部分视为商业叙事,而不是能力进步本身。
模型能力不会消失,而会从加分项变成门槛
上面的证据支持“边际价值正在递减”,却不支持“模型能力已经停滞”。事实上,Stanford 2026 AI Index 对技术趋势的总结恰恰是能力仍在加速,Agent 在 OSWorld 上的准确率也从约 12% 提高到了 66.3%。
所谓“模型能力越来越不重要”,更准确的说法是:当主流模型逐渐覆盖常见需求以后,继续提升能力所带来的主观体验开始减弱。这是一种体感和经济意义上的平台期,而不一定是模型能力真正达到了上限。
对于写摘要、修改措辞、整理资料等任务,当前模型可能已经足够好。此时再增加少量能力,很难像降低延迟、减少成本那样明显地改变使用方式。基础智能在这些场景中会逐渐商品化,用户开始关注模型之外的部分:上下文能否保持、输出是否稳定、工具是否好用、个人偏好能否被理解。
但在复杂软件工程、学术研究、法律分析等任务中,能力差距仍然可能决定结果是否可用。很多任务并不是连续平滑的,而是存在一个能力阈值:
- 没有跨过阈值时,模型即使完成了大部分步骤,整体结果仍然不可用
- 跨过阈值之后,速度、成本和可靠性才开始成为主要差异
因此,模型能力更像一种准入条件。它不一定始终是用户最强烈的感知点,却决定了产品能够进入哪些场景。
结论:递减的是边际价值,不是技术进步
综合来看,我仍然会肯定地回答开头的问题:大模型正在进入边际收益递减阶段,但主要发生在用户感知和商业差异层面。
模型能力仍在快速增长,也仍会不断跨过新的任务门槛。只是当头部模型越来越接近、旧评测逐渐饱和、同等能力迅速降价以后,“比上一代更聪明一点”将越来越难独立构成产品优势。竞争会自然向速度、成本、可靠性、应用入口和工作流迁移。
这不是模型能力不再重要,而是它正在从一种稀缺卖点变成基础设施。像计算、存储和网络一样,基础能力越普及,人们就越少讨论它本身,越关心它最终能否稳定地解决问题。
参考资料
- Stanford HAI, Technical Performance — The 2026 AI Index Report
- Stanford HAI, Responsible AI — The 2026 AI Index Report
- Stanford HAI, The 2025 AI Index Report
- Epoch AI, Epoch AI 2025 impact report
- Epoch AI, Open models lag state-of-the-art closed models by 4 months
- OpenAI, Introducing the Codex app
- Anthropic, Introducing Claude 4
- Google, The Gemini app becomes more agentic, delivering proactive, 24/7 help