AI 记性定价战开打:上下文成 Agent 商业化新底牌
当 Ramp 的工程师在监控屏上看到那条 38 小时无人值守的机器学习任务曲线平稳收尾时,他们第一次觉得,让 AI"睡着觉干活"这件事终于不再是实验室里的行为艺术。支撑这场"睡眠实验"的,不是 OpenAI 那套越打越便宜的算力组合拳,而是 Anthropic 悄悄改动的一个小数点——缓存读取价从每百万 token 1 美元跌到 0.25 美元,一刀砍掉 75%。
2026 年 9 月,当所有人都在盯着 Claude Fable 5.1 翻倍的 benchmark 分数时,真正让华尔街量化基金和硅谷极客彻夜难眠的,恰恰是这张价格表上最不起眼的一行字。这一刀的位置,才是整场发布真正的题眼。
两种定价逻辑:卷"智商税"还是卷"租金"
长久以来,AI 模型的定价叙事围绕"单次智能"展开——输入多少钱、输出多少钱,比拼的是谁的单价比谁低。OpenAI 在 2026 年 6 月推出 GPT-5.6 家族,把旗舰 Sol 定在 5 美元输入、30 美元输出,随后在 7 月把 Luna 砍价 80%,8 月再给 Sol 降超两成,一路把"每单位智能"的价格往死里压。
Anthropic 却反其道而行。它没有动那根最显眼的输入输出价签,而是把降价火力集中在一个更隐蔽、却更决定 Agent 经济命脉的地方——缓存读取。
先看几组数字。Claude Fable 5.1 的输入价仍为每百万 token 10 美元,输出价 50 美元,与上一代完全持平,普通输入甚至是自家 Opus 5 的两倍。表面上看,它更贵了。但缓存读取价从 1 美元跌到 0.25 美元,降幅 75%,而这个 0.25 美元只相当于 Fable 正常输入价的 2.5%,远低于其他 Claude 模型普遍采用的 10% 折扣系数。
这是整件事最反直觉的逻辑:Anthropic 在对"新想法"收最贵的税,却在对"旧回忆"做最狠的补贴。
长时域 Agent 的成本曲线是另一条形状
传统上,我们习惯把模型成本等同于"吞吐"——输入和输出像水流过水表,流多少付多少。但长时域 Agent 的成本曲线是另一条形状:它在一个项目上跑几小时、几十小时,每一步都在往同一个上下文里叠加状态,而这些状态里真正新产生的 token 只占很小一部分,绝大多数是反复读取的、已经算过一遍的旧信息。缓存读取,就是为这种"重复记忆"单独开的价。
Anthropic 官方给出的账本是:典型任务整体成本下降约 25%,高度 Agent 化的任务最高下降约 45%。这个数字指向同一件事——当一个 Agent 不再是一次问答,而是反复回到同一套代码库、同一批工具定义、同一段不断累积的对话历史时,成本的大头早已不是"生成一个新 token",而是"把已经处理过的上下文再读一遍"。
这就好比一家航空公司,头等舱票价涨到天价,但燃油费突然打 0.25 折。因为 Anthropic 赌的是,未来的 AI 不是坐一次就下飞机的过客,而是包机飞越太平洋的常驻机长。对于机长而言,占大头的永远不是起飞那一下的推力,而是平流层里持续几十个小时的巡航油耗。
能力翻倍之外,是"能撑"而不是"更大"
降价之外,Fable 5.1 的能力跃升同样值得拆开看。在 Terminal-Bench-Science 0.1 这项让模型在终端里独立规划、执行并核验科学研究流程的评测上,Fable 5.1 拿到 52.6%,上一代 Fable 5 只有 24.7%,翻了一倍还多;作为参照,OpenAI 的旗舰 GPT-5.6 Sol 是 22.4%,Anthropic 自家的 Opus 5 是 29.0%。AutomationBench 从 17.1% 涨到 31.4%,Terminal-Bench 4.0 从 42.0% 涨到 55.8%,Mythos 5.1 更是摸到 60.9%。
一个容易被忽略的细节是,这些分数是模型被"生产级安全防护"的护栏箍着跑出来的——在 OSWorld 和 AutomationBench 上,但凡防护机制出手拦截,直接记零分。这反而意味着真实上限还要更高。
但能力的真正变化,藏在那批早期客户的只言片语里。Jane Street 的量化研究主管 Craig Falls 说,Fable 5.1 解决了更多他们的编码难题,而且"以前的模型跑得越久越难读懂,Fable 5.1 在漫长的多步任务里始终可读"。Millennium 的一位高级基金经理讲了一个更具体的案例:一段大约百万分之一概率触发的罕见崩溃,团队里没人能在四五年里解释清楚,所有试过的模型包括 Fable 5 都错过了,Fable 5.1 是第一个找到的——它把外部供应商的库反汇编、和 core dump 对上了号。MongoDB 的工程师描述了三天搭建复杂原型、夜里无人值守跑数小时的场景。
把这几件事连起来,结论已经非常清晰:Fable 5.1 的"翻倍"不是靠把模型做得更大,而是靠把模型做得更"能撑"。它不再追求在单点上多答对几分,而是追求在长链条上少崩、少偏、少让人重来。这恰恰是 Agent 商业化的真正门槛——一个能在三小时内答对难题的模型,和一个能连续三天不跑偏的模型,卖的是两种完全不同的东西。
谁在为"记性好"买单
把定价、能力和发布策略三条线合起来看,2026 年 AI 竞争的下半场轮廓就清晰了。上半年,主战场是"单次智能的价格",OpenAI 把性价比算到极致,逼着整个行业往低价走。但 Anthropic 的这记缓存降价,把战争从"生成"转移到了"记忆"。
对真正在做长时域 Agent 的公司来说,这张牌的分量已经显现。Cognition 的联合创始人 Walden Yan 说得很直白:他们要在发布日当天把 Devin 里的 Opus 5 流量迁到 Fable 5.1,原因是"有了新的缓存读价,Fable 级模型终于对这类工作负载经济可用"。这句话里藏着一个行业信号——此前,很多本可以上最强模型的重度工作,因为缓存成本不划算,被迫降级到次一档的模型,如今这个约束被拆掉了。
换句话说,Anthropic 降价降的不是模型,是"把最强模型当常驻 Agent 用"的门槛。这比单纯便宜更有杀伤力,因为它直接改变了客户的选型逻辑,从"够用就好"变成"最强也养得起"。
记忆层的兴起与中间厂商的两线失血
这场定价战还有一个更大的背景:记忆正在成为整个 Agent 技术栈的稀缺资源。OpenRouter 上 Agent 消耗的 token 已接近人类的 5 倍,2 月以来上涨 14 倍;有分析指出 65% 的企业 AI Agent 失败可追溯到上下文漂移而非模型能力;Mem0 一家公司就已融资 2450 万美元,每季度处理 1.86 亿次 API 调用,2026 年中期 7 周内就有 4 个托管 Agent 记忆层相继上线。连英伟达都因内存芯片成本飙升而通知客户服务器涨价超 15%——算力端的记忆涨价,与应用端的记忆降价,从两个方向把"记忆"推到了舞台中央。
这场定价变局里,真正该紧张的未必是 OpenAI。OpenAI 的 Luna、Terra 降价瞄准的是长尾用户和大规模推理,它有自己的缓存折扣,但降价主体仍是"输入输出",缓存仍按输入价的固定比例折扣。Anthropic 则把缓存读单独拉到地板价,相当于在"持续型 Agent"这个细分场景里建立了一个价格锚点。更危险的是那些夹在中间的模型厂商——既没有 OpenAI 的规模去玩普惠降价,也没有 Anthropic 的纵深去重构成本结构,当头部玩家开始对"记忆成本"动刀时,跟随者会在两条战线上同时失血。
新的标尺
对用户和开发者,信号很明确:接下来评估一个模型,不能只看那张输入输出价签,还要把"你的工作负载里,有多少是反复读取的上下文"算进去。如果你的场景是一次性问答,Anthropic 的降价与你关系不大;如果你的场景是一个要跑几小时的 Agent,那这 75% 可能比任何 benchmark 分数都更值钱。
缓存读取价,这个长期待在价格表最不起眼角落的数字,正在成为 AI 竞争的新刻度尺。当模型足够聪明到能连续工作数十小时,决定它能不能规模化落地的,就不再是它想得有多快,而是它记得有多便宜。当 AI 的记忆比人类的遗忘还便宜时,Agent 才真正从"玩具"变成了"工具"——这场关于记忆成本的定价战,比任何一次参数升级都更接近 AI 商业的真相。