跳到主要内容

模型发布当天就过时:单任务成本成选型新标尺

过去一周,Grok 4.5、GPT-5.6、Claude Sonnet 5 接连登场。放在一年前,这样的发布密度意味着又一轮「谁最强」的排行榜争夺;但在 2026 年的现实里,一个耐人寻味的现象是:模型发布当天就可能「过时」——不是被更强的能力打败,而是被更低的单任务成本、更合适的调用方式重新定价。

行业主线已经从「模型能否可用」切换到「模型能否被持续付费使用」。天风证券研报的判断在多个数据点上得到印证:Kimi 的 ARR 在 2026 年 3 至 6 月连续跨过 1 亿、2 亿、3 亿美元门槛;OpenRouter 平台 Token 总量周环比增长 9.65%;腾讯混元 Hy3 从 preview 到正式版,日均 token 消耗增长 20 倍。大模型正从低频试用转向高频的持续性工作流,选型标尺也随之改变。

从「谁最强」到「单任务成本」:竞争逻辑的重构

过去的选型逻辑很简单:看基准测试,谁分数高选谁。但当日常任务大多不需要旗舰级能力时,「最强」就失去了决策意义。单任务成本(cost per task)正在取代 token 单价,成为更核心的衡量指标。

单任务成本的粗略公式是:

单任务成本 = 总模型与工具支出 ÷ 通过质量门槛的输出数量

它把一整条任务链路都纳入账本:输入输出 token 数量、调用轮次、上下文长度、工具调用次数、推理强度、失败重试率、缓存命中率,以及人工审查成本。这意味着竞争焦点从「能力最大化」转向「有效能力的成本最优化」。

为什么 token 单价会骗人

单看「每百万 token 多少钱」会得出系统性误判。一个定价便宜的模型,如果完成任务需要更多轮次、更长上下文、更高重试率,它的单任务成本可能反而更高;反过来,一个看似更贵的模型,如果能用更少轮次一次做对、减少返工,最终可能更划算。

模型路由的成本模型把这个道理量化得很清楚:级联策略先让便宜模型试做,质检不通过再交给旗舰模型重做。设便宜模型单任务成本为 c、旗舰为 C、便宜模型失败率为 f,则只有当 f×C < (C−c) 时级联才划算。在 2026 年 8 月的价格地图上,最便宜的 agent 级模型与最贵的输出 token 价差已经拉大到约 35 倍——DeepSeek V4 Flash 输出约 $0.28/百万 token,GPT-5.6 Sol 高达 $30。「无脑用最强模型」在这个价差下,等于在给本可省下 90% 以上成本的任务链段白付钱。

大厂的三种解法:分层、effort、场景反向定义

面对单任务经济性,主流厂商给出了三条不同的工程路径。

OpenAI 走场景分层:GPT-5.6 以 Sol / Terra / Luna 取代「旗舰 + mini」命名体系。Sol 负责复杂推理与编程($5/$30),Terra 对标上一代旗舰($2/$15),Luna 主打高并发低延迟走量($1/$6),三层之间最多差 5 倍价。更关键的是裸别名 gpt-5.6 默认路由到最贵的 Sol 层——不显式指定层级,生产请求就按旗舰费率计费,倒逼开发者逐个任务思考层级归属。

Anthropic 走 effort 机制:Claude Sonnet 5 不再接受 temperature 等传统采样参数,改用 low → medium → high → xhigh → max 的推理强度刻度。Anthropic 的测量显示,Opus 4.5 上 medium effort 即可达到 Sonnet 4.5 的 SWE-bench 得分,同时输出 token 减少 76%。「选什么模型」之外又多了一个「投入多少算力」的旋钮。

xAI 走场景反向定义:Grok 4.5 与 Cursor 联合训练,先锁定编程 Agent 这个高频场景,再用数万亿真实交互 token 反推模型设计,定价压到 $2/$6。马斯克发布会上的表态很直白:Fable 确实更好,但大多数任务并不需要那个级别的能力。

国产厂商则把性价比前置到架构层:DeepSeek V4 Flash 284B 总参数、每 token 仅激活 13B;混元 Hy3 295B 总参数、21B 激活;Kimi K2.6 1T 总参数、32B 激活。MoE 大参数小激活路线,让能力池接近超大规模模型,同时单次推理不必承担全量参数的计算开销。

价格日历:选型从一次性决策变成持续任务

「发布当天就过时」还有一层更现实的含义:价格变动比模型发布更频繁。2026 年 7 月 30 日,OpenAI 将 GPT-5.6 Luna 降价 80% 至 $0.20/$1.20、Terra 降价 20% 至 $2/$12;Claude Sonnet 5 的介绍价 $2/$10 则在 8 月 31 日到期,9 月 1 日起涨至 $3/$15——一夜之间默认层的账单贵 50%。定价页面往往跑得比博客、比你的部署还快,固定住某个模型反而是最贵的选项。

实践路径:路由、可插拔客户端、自建评测

应对这种动态格局,企业侧的工程手段已经成型。模型路由是其中核心:Amazon Bedrock 的 Intelligent Prompt Routing、Azure AI Foundry 的 Model Router,以及 OpenRouter、LiteLLM、Dify 等生态工具,都在把「手动选模型」推进为「按任务复杂度、成本、延迟统一调度」。

可插拔客户端是让路由真正可用的前提——一次调用只暴露一个接口,模型由工作负载和配置决定,绝不硬编码在调用点。这样当下一轮降价落地时,迁移流量只是改配置,而不是重构代码。

评测也要跟着换标尺。跨厂商基准测试因评测框架不同而不可比,两分之差等于打平;真正该关注的是自家任务上的成功率、工具调用有效性,以及「每个完成任务的成本」而非「每个 token 的成本」。DeepSeek 首方 API 约 98% 的缓存折扣、Kimi K3 缓存命中后输入从 $3 降到 $0.30——这些真实账本只有自建评测才能算清。

行业影响:默认调用之争与杰文斯时刻

单任务成本逻辑最终会把竞争推向「默认调用」之争:谁能进入云平台、AI 网关、企业级中台的默认配置,谁就拿到更高比例的真实调用与真实反馈,再推动成本下降,形成飞轮。Google 把 Gemini 嵌入 Gmail 与 Docs、Adobe 把 Firefly 嵌入创意工作流,本质上都在抢占这个入口。

更深一层,这也指向大模型的「杰文斯时刻」:蒸汽机效率提升后煤炭消耗反而上升,因为使用门槛降低让需求边界扩张。性价比竞争的结果未必是 AI 总成本下降,而是 AI 使用密度上升——模型调用从少数高价值任务扩散到大量日常任务。对企业来说,这意味着模型选型不再是一个发布季的决策,而是一项持续的、以单任务成本为标尺的工程能力。