适合读者:AI 应用已上线、正在为 Token 账单发愁的团队;做 AI 工程交付的技术负责人;评估 AI 项目成本的决策者
上个月一个客户带着近三个月的 AI 账单来找我们,说了一句话:
“AI 用得起,但账单越滚越大,老板开始问了。”
我们拉出他的调用明细看了一眼:同一个接口,80% 的流量是\”查订单状态\”\”提取关键词\”这类简单任务,全走的是旗舰大模型。系统提示词反复灌进去、同样的知识库文档每次请求都重新计算一遍——三个放大因子叠在一起,把一份 1 块钱的活,烧成了 20 块。
这个客户的困境不是个例:大多数 AI 项目成本失控,不是模型选错了,而是\”所有请求都走同一个模型\”这个默认配置错了。
模型路由(Model Routing)就是干这件事的:按任务难度把请求分层,简单任务走便宜小模型,复杂任务才走旗舰模型。这套机制 + 两个缓存杠杆,是 2026 年企业 AI 成本控制里确定性最高的工程动作——不换模型、不重构业务,把流量分层做对,账单就能实打实降下来。
一、先算账:AI 账单里的钱,到底烧在哪
LLM 调用成本 = 输入 Token 单价 × 输入量 + 输出 Token 单价 × 输出量。看起来简单,但现实里有三个因子会把账单放大几倍到几十倍:
放大因子 1:上下文膨胀(最隐蔽的烧钱点)
一次 RAG 问答的真实 Token 构成大概是这样的:
系统提示词(固定) ~800 Token
知识库检索片段 ~2000-8000 Token
历史对话(逐轮累积) ~1500 × N 轮
用户问题(很小) ~100 Token
用户问题只占输入的 5% 以内,其余全是上下文。 而输入 Token 每次请求都要重新计算——上下文越长、并发越高、对话轮数越多,账单膨胀得越快。
放大因子 2:模型规格错配
| 关键词分类、表单抽取 | 小模型 | 全走旗舰大模型 |
| 摘要、改写、翻译 | 中档模型 | 全走旗舰大模型 |
| 复杂推理、代码生成 | 旗舰大模型 | —(合理) |
| 结构化输出(JSON 抽取) | 小模型 + 强约束 | 全走旗舰大模型 |
全量流量走旗舰模型,等于用 20 倍的价格完成 80% 本可以用小模型完成的任务。



