各大平台这两年都在推“自动选模型”功能:你不用指定用哪个模型,系统按任务难度动态匹配——简单问题派便宜的小模型,复杂任务才动用贵的旗舰。杀鸡用鸡刀,杀牛用牛刀。
我在课上把这套逻辑讲给学员听的时候,所有人都觉得这是省钱妙招。直觉上它确实无懈可击:大部分日常任务根本用不着旗舰模型,让路由器替你精打细算,怎么算都是赚。
我自己一开始也这么认为。直到认真看过账单的构成,我改了主意:这类智能路由,在很多真实使用场景里反而让你花更多钱。
问题出在一个大多数人没注意过的计费细节上——缓存命中。
切换的那一瞬间,发生了什么
先解释一下什么是缓存命中。
你和 AI 的对话是一段持续累积的上下文:前面所有的问答、你贴过的文件、定过的规矩,每新一轮对话都要作为输入提交给模型。如果这些内容和上一轮完全一样——它们本来就一样,是你之前的历史——厂商的计算系统可以复用上一次的计算结果,只对新增的部分重新计算。这部分被复用的输入,就是“缓存命中”,按缓存价计费。缓存价比正常输入价低得多,通常是数量级的差距。
现在再看模型路由干了什么。它判断你这个新问题很简单,把模型从 A 切到了 B。对模型 B 来说,你之前跟 A 聊的所有内容,它一次都没见过——整个上下文对它是全新的,缓存命中在那一刻是零,全部按全价重新计费。
更糟的是,如果你接着切回 A,A 也要重新算一遍。来回切换,两个模型的缓存都建立不起来。路由替你省下的那点“模型差价”,远远抵不上缓存归零重新算账的损失。
比单价更要紧的,是命中率
想明白这个机制,再回头看“怎么选模型便宜”这个问题,答案会变。
大多数人比价的方式,是看各家公布的输入输出单价表。但同一份工作交给同一个模型,实际花费可能差好几倍,差别就在命中率:一个会话从头到尾用同一个模型,上下文持续复用,我观察过长对话里绝大部分 token 是按缓存价结算的;另一个会话频繁切换模型,几乎每一轮都在为全部历史付全价。
单价表上便宜几分钱的模型,配上糟糕的使用方式,账单可以比贵的模型还难看。决定你总费用的,首先是你用得连不连续,其次才是单价。
这也解释了一个现象:同一个模型,在不同产品里“手感”和账单都不一样。各家产品对上下文的组织、提交、复用策略不同,命中率就不同。模型是同一个模型,计费不是同一本账。
四条实在的建议
第一,没有必要的切换,就不切。模型路由功能开着可以,但别把它当成省钱的保证。长对话、重要项目,固定一个够用的模型跑到底,往往比“智能调配”便宜。
第二,比较成本看实际账单,不看单价表。多数厂商后台能看到用量构成,重点看缓存命中的比例。比例高,说明你的用法在省钱;比例低,先检查是不是自己频繁换模型、频繁开新会话。
第三,大额消耗之前,先跑小样本。同样一类任务,用两种方式各跑一小段,看账单构成再决定怎么批量跑。这一步花的钱,比直接批量跑错了再反思便宜得多。
第四,长周期承诺要谨慎。包年套餐折扣最大,但我一般不推荐——模型迭代太快,买完包年很容易后悔,付费能力与产品形态都在变。按量兜底,配合月度或季度的订阅,进可攻退可守。
什么时候该关心成本
最后补一个态度。上面这些优化,有一个适用前提:你的用量已经大到值得优化。
如果一个月的消耗还很小,别把精力花在比价上,使劲用、换着花样用。这个阶段,消耗量的增长是你学习和进步的度量衡,为几块钱的账单研究缓存策略,省下的是钱,搭进去的是成长速度。
等账单真的变成一项开支了,再回头做优化——那时候你已经知道自己的使用模式,优化才有抓手。
在 AI 的计费体系里,连续性本身就是钱。省钱的第一性,从来都是少折腾。
作者简介: 陈石律师(主页 chenshi.ai),浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办“首宗百亿地王”“长春第一高楼”“台州第一高楼”等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,并在多地开展相关主题讲座与分享。