各大平台这两年都在推“自动选模型”功能:你不用指定用哪个模型,系统按任务难度动态匹配——简单问题派便宜的小模型,复杂任务才动用贵的旗舰。杀鸡用鸡刀,杀牛用牛刀。

我在课上把这套逻辑讲给学员听的时候,所有人都觉得这是省钱妙招。直觉上它确实无懈可击:大部分日常任务根本用不着旗舰模型,让路由器替你精打细算,怎么算都是赚。

我自己一开始也这么认为。直到认真看过账单的构成,我改了主意:这类智能路由,在很多真实使用场景里反而让你花更多钱。

问题出在一个大多数人没注意过的计费细节上——缓存命中。

切换的那一瞬间,发生了什么

先解释一下什么是缓存命中。

你和 AI 的对话是一段持续累积的上下文:前面所有的问答、你贴过的文件、定过的规矩,每新一轮对话都要作为输入提交给模型。如果这些内容和上一轮完全一样——它们本来就一样,是你之前的历史——厂商的计算系统可以复用上一次的计算结果,只对新增的部分重新计算。这部分被复用的输入,就是“缓存命中”,按缓存价计费。缓存价比正常输入价低得多,通常是数量级的差距。

现在再看模型路由干了什么。它判断你这个新问题很简单,把模型从 A 切到了 B。对模型 B 来说,你之前跟 A 聊的所有内容,它一次都没见过——整个上下文对它是全新的,缓存命中在那一刻是零,全部按全价重新计费。

更糟的是,如果你接着切回 A,A 也要重新算一遍。来回切换,两个模型的缓存都建立不起来。路由替你省下的那点“模型差价”,远远抵不上缓存归零重新算账的损失。

同样的对话,两种计费路径 固定一个模型 中途切换模型 历史上下文按缓存价结算 切换后历史按全价重算 缓存价(低) 全价(高) 示意:每行为一轮对话的输入构成 · 灰色为可复用部分

比单价更要紧的,是命中率

想明白这个机制,再回头看“怎么选模型便宜”这个问题,答案会变。

大多数人比价的方式,是看各家公布的输入输出单价表。但同一份工作交给同一个模型,实际花费可能差好几倍,差别就在命中率:一个会话从头到尾用同一个模型,上下文持续复用,我观察过长对话里绝大部分 token 是按缓存价结算的;另一个会话频繁切换模型,几乎每一轮都在为全部历史付全价。

单价表上便宜几分钱的模型,配上糟糕的使用方式,账单可以比贵的模型还难看。决定你总费用的,首先是你用得连不连续,其次才是单价。

这也解释了一个现象:同一个模型,在不同产品里“手感”和账单都不一样。各家产品对上下文的组织、提交、复用策略不同,命中率就不同。模型是同一个模型,计费不是同一本账。

四条实在的建议

第一,没有必要的切换,就不切。模型路由功能开着可以,但别把它当成省钱的保证。长对话、重要项目,固定一个够用的模型跑到底,往往比“智能调配”便宜。

第二,比较成本看实际账单,不看单价表。多数厂商后台能看到用量构成,重点看缓存命中的比例。比例高,说明你的用法在省钱;比例低,先检查是不是自己频繁换模型、频繁开新会话。

第三,大额消耗之前,先跑小样本。同样一类任务,用两种方式各跑一小段,看账单构成再决定怎么批量跑。这一步花的钱,比直接批量跑错了再反思便宜得多。

第四,长周期承诺要谨慎。包年套餐折扣最大,但我一般不推荐——模型迭代太快,买完包年很容易后悔,付费能力与产品形态都在变。按量兜底,配合月度或季度的订阅,进可攻退可守。

什么时候该关心成本

最后补一个态度。上面这些优化,有一个适用前提:你的用量已经大到值得优化。

如果一个月的消耗还很小,别把精力花在比价上,使劲用、换着花样用。这个阶段,消耗量的增长是你学习和进步的度量衡,为几块钱的账单研究缓存策略,省下的是钱,搭进去的是成长速度。

等账单真的变成一项开支了,再回头做优化——那时候你已经知道自己的使用模式,优化才有抓手。

在 AI 的计费体系里,连续性本身就是钱。省钱的第一性,从来都是少折腾。


作者简介: 陈石律师(主页 chenshi.ai),浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办“首宗百亿地王”“长春第一高楼”“台州第一高楼”等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,并在多地开展相关主题讲座与分享。