前沿模型不再自动胜出:企业开始重新计算 AI 的总成本
模型市场正在出现一个很实际的变化:最强模型仍然有价值,但它不再天然是企业的默认选择。采购决策开始从“能力上限”转向任务成功率、Token 成本、延迟、数据政策和工作流兼容性的综合比较。
支付平台 Ramp 在 7 万多家美国企业的支出数据中发现,Anthropic 最高价的 Claude Fable 5 上线后,占 Anthropic 模型支出的约 11.4%,对应 Token 用量约 6%。作为对照,OpenAI 的 GPT-5.6 Sol 占其模型 Token 用量约 25%、支出约 23%。Ramp 的样本偏向技术型企业,不能代表全部市场,但它反映出一个趋势:更强的能力并不必然换来更高的企业采用率。
这不是 Fable 5 的性能问题。Anthropic 将它定位为复杂软件工程、研究和知识工作的高能力模型;但对大量日常任务来说,性能更接近、价格更低的模型可能已经足够。Anthropic 在 7 月推出的 Claude Opus 5 就是一个例子:官方称它以约一半成本接近 Fable 5 的能力,并允许用户通过 effort 设置在质量、速度和 Token 消耗之间调整。
OpenAI 的策略也类似。GPT-5.6 将模型分为 Sol、Terra 和 Luna 三档,分别服务高难度推理、平衡型任务和高频低成本调用,并在后续下调了部分档位价格。模型厂商正在把“以更少 Token 完成同样工作”变成产品竞争的一部分,而不是只争单项能力榜单。
另一侧,开放权重模型正在让 API 定价变得更分散。DeepSeek-V4 已开放权重,官方 API 只是获得模型能力的一种方式;云厂商、聚合平台和第三方 Agent 产品可以自建或托管部署,在价格、限额、延迟与数据政策上提供不同组合。DeepSeek 官方近期调整 V4 API 价格后,这种差异会更容易被开发者感知。
例如,Freebuff 的公开配置中仍提供 DeepSeek V4 Pro 的免费使用入口,但同时标注了数据可能用于训练。OpenRouter 上的 Ox Alpha 目前也是免费预览,提供 100 万 Token 上下文和多模态输入,但模型提供方尚未公开,免费状态和可用性都可能变化。免费不等于零成本,只是成本被广告、数据使用、排队、限额或稳定性等条件重新分配。
这也解释了为什么“更便宜的开放模型正在替代美国闭源模型”不能被简单化。Ramp 的数据显示,模型服务平台和开放模型的使用在增长,但新采用 AI 的企业仍主要从美国模型厂商开始。更可能的现实是,团队正在形成多模型分层:把昂贵的前沿模型留给高难度、错误代价高的任务,把日常编码、批处理和试验性 Agent 工作流交给性价比更好的选择。
对开发团队来说,下一步不是寻找一个永远最强或永远免费的模型,而是建立按任务路由的评测与成本机制:用真实任务比较成功率、延迟、Token 消耗和返工率;为私有代码单独评估数据保留与训练政策;再根据结果决定哪些任务值得使用旗舰模型,哪些任务应该切换到低成本或开放权重方案。
模型市场正在出现一个很实际的变化:最强模型仍然有价值,但它不再天然是企业的默认选择。采购决策开始从“能力上限”转向任务成功率、Token 成本、延迟、数据政策和工作流兼容性的综合比较。
支付平台 Ramp 在 7 万多家美国企业的支出数据中发现,Anthropic 最高价的 Claude Fable 5 上线后,占 Anthropic 模型支出的约 11.4%,对应 Token 用量约 6%。作为对照,OpenAI 的 GPT-5.6 Sol 占其模型 Token 用量约 25%、支出约 23%。Ramp 的样本偏向技术型企业,不能代表全部市场,但它反映出一个趋势:更强的能力并不必然换来更高的企业采用率。
这不是 Fable 5 的性能问题。Anthropic 将它定位为复杂软件工程、研究和知识工作的高能力模型;但对大量日常任务来说,性能更接近、价格更低的模型可能已经足够。Anthropic 在 7 月推出的 Claude Opus 5 就是一个例子:官方称它以约一半成本接近 Fable 5 的能力,并允许用户通过 effort 设置在质量、速度和 Token 消耗之间调整。
OpenAI 的策略也类似。GPT-5.6 将模型分为 Sol、Terra 和 Luna 三档,分别服务高难度推理、平衡型任务和高频低成本调用,并在后续下调了部分档位价格。模型厂商正在把“以更少 Token 完成同样工作”变成产品竞争的一部分,而不是只争单项能力榜单。
另一侧,开放权重模型正在让 API 定价变得更分散。DeepSeek-V4 已开放权重,官方 API 只是获得模型能力的一种方式;云厂商、聚合平台和第三方 Agent 产品可以自建或托管部署,在价格、限额、延迟与数据政策上提供不同组合。DeepSeek 官方近期调整 V4 API 价格后,这种差异会更容易被开发者感知。
例如,Freebuff 的公开配置中仍提供 DeepSeek V4 Pro 的免费使用入口,但同时标注了数据可能用于训练。OpenRouter 上的 Ox Alpha 目前也是免费预览,提供 100 万 Token 上下文和多模态输入,但模型提供方尚未公开,免费状态和可用性都可能变化。免费不等于零成本,只是成本被广告、数据使用、排队、限额或稳定性等条件重新分配。
这也解释了为什么“更便宜的开放模型正在替代美国闭源模型”不能被简单化。Ramp 的数据显示,模型服务平台和开放模型的使用在增长,但新采用 AI 的企业仍主要从美国模型厂商开始。更可能的现实是,团队正在形成多模型分层:把昂贵的前沿模型留给高难度、错误代价高的任务,把日常编码、批处理和试验性 Agent 工作流交给性价比更好的选择。
对开发团队来说,下一步不是寻找一个永远最强或永远免费的模型,而是建立按任务路由的评测与成本机制:用真实任务比较成功率、延迟、Token 消耗和返工率;为私有代码单独评估数据保留与训练政策;再根据结果决定哪些任务值得使用旗舰模型,哪些任务应该切换到低成本或开放权重方案。