显示价格走势的金融图表

大模型 API 价格战:一百万 Token 到底值多少钱

过去一年,大模型 API 的价格几乎每个月都在刷新下限。对开发者来说是好事,但价格表越来越复杂:输入输出分开计费、缓存折扣、批量折扣、分级定价……这篇文章把常见的计价规则拆开,帮你算清楚一百万 Token 背后的真实成本。

价格阶梯:旗舰、轻量与自部署

把市场上的主流选择粗略分成三档:旗舰模型(最强推理能力,单价最高)、轻量模型(速度快、价格低一到两个数量级)、开源模型自部署(表面单价最低,但要摊上卡的成本和运维人力)。同一个任务,聪明地在这三档之间分配,总成本常常能差出一个数量级。

输入与输出不是一个价

几乎所有厂商的输出 Token 都比输入贵——通常是三到五倍。原因很简单:生成是逐 Token 的重计算,而输入可以大规模并行处理。由此带来两个实用结论:其一,冗长的系统提示词其实没有想象中贵;其二,让模型”少说废话”,比压缩提示词更能省钱。

另一个容易被忽略的是前缀缓存折扣:多轮对话里,历史消息如果被服务商缓存命中,这部分输入的价格可以打折。对高频对话类应用,缓存能省下 30% 以上的输入费用。

笔记本电脑上的成本分析面板
把每次调用的输入输出 Token 记进账本,成本结构一目了然

隐藏成本:重试、工具调用与上下文膨胀

真实账单常常比理论估算高,原因多半在三个地方:失败重试、Agent 场景的工具调用循环,以及多轮对话中不断膨胀的上下文。一个简单的对策是在应用层做 Token 预算:给每次请求设上限,对话过长就主动摘要压缩,重试加退避并设次数上限。

一笔参考账:客服机器人月账单

假设一个客服机器人每天处理两千次对话,平均每次对话输入一万 Token、输出一千 Token。按主流轻量模型的价格估算,月账单大约在几百到一千元人民币的量级;换旗舰模型则要乘以十倍以上。这个数量级差异,正是”选对模型”比”抠提示词”更重要的原因。

结论很朴素:把价格表读明白,比追逐任何单一厂商的促销都更省钱。


延伸阅读:Tokenizer 工作原理:为什么中文更费 Token · 2026 年 AI 算力市场观察:从一卡难求到按 Token 计价

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

滚动至顶部