Token 与计费逻辑:你付的 API 费到底花在哪

一句话结论:输入输出分开计价,账单滚雪球;贵在长上下文与循环

读之前建议先懂: 上下文窗口:AI 的"工作记忆"为什么有限,又为什么越来越不够用

📌 本页有意不写任何具体价格。价格按月变动,写死的数字会在几周内变成误导——本页只讲计费机制与省钱杠杆。做采购决策前,请查各厂商官方定价页。

当前判断

  1. 贵不在单次问答,贵在高频、长上下文、全自动三类场景。
  2. 三条省钱杠杆:砍上下文 > 模型分级 > 控制输出。
  3. Agent 循环是成本放大器:20 步任务轻松百倍消耗。

一句话结论

API 按 Token 收费,且输入(提示)和输出(回答)分开计价——你的钱 = 每一轮都重新发送的全部上下文 × 输入单价 + 生成的回答 × 输出单价。长对话越来越贵,是因为账单是”滚雪球”式的。

逻辑链

模型按 Token 处理文本(见 01-llm是如何思考的)→ API 每次调用都要重发全部历史(见 02-上下文窗口)→ 输入 Token 随对话轮次累积增长 → 费用 ≈ Σ(每轮的上下文长度) × 输入价 + 输出长度 × 输出价 → 所以”聊得越久、贴得越多、Agent 循环越多”,成本超线性上涨

展开

1. 三条省钱的杠杆(按效果排序)

  1. 砍上下文:定期让 AI 总结结转、丢弃无关历史——直接砍掉最大的成本项
  2. 模型分级:简单任务(改写/分类/摘要)用小模型,难题才用旗舰模型;不同档位模型的单位价差可达一个数量级以上
  3. 控制输出:明确要求”50 字内""只列要点”——输出单价通常显著高于输入单价(具体倍数随模型与时期变化,以官网为准)

2. 为什么 Agent 贵

Agent 每一步循环都带着全部历史 + 工具返回的大段内容再跑一遍模型(见 06-Agent的逻辑)。一个 20 步的 Agent 任务,Token 消耗轻松是普通对话的百倍。用 Agent 前先问:这个任务的产出值多少钱?

3. 换算手感

不写具体数字,只给可复用的手感:把 Token 想成”字数”,把上下文想成”每轮都要重交一遍的作业”。于是成本 = 作业长度 × 交的轮数。真正要盯的不是单次问答(单次极便宜),而是高频 × 长上下文 × 全自动这三件事叠在一起的场合——它们才是账单失控的地方。需要数字时请查厂商官网定价页。

决策规则

条件(IF)动作(THEN)
成本超预期按顺序砍:上下文 → 模型档位 → 输出长度(顺序即效果排序)
要上 Agent / 自动化先设预算熔断(超 X 元自动停),再谈能力
只是日常问答用网页版订阅即可,不必上 API

常见误区

现在就能做的事

相关页面

出处与置信度

引用点出处类型核验
Token 是处理与计费单位、输入/输出分开计价、每轮重发全部上下文由 01-llm是如何思考的(Token 化)+ 02-上下文窗口(每轮读入全部上文)推导[推导]✅ 机制稳定
上下文缓存只对”前缀重复高”的场景有效各厂商官方缓存定价说明[官方文档]⚠️ 待核验:规则随厂商而变
具体价格、模型档位价差各厂商官方定价页[官方文档]⚠️ 待核验(有意不写):本页只讲机制

策略说明(待站长确认):本页刻意不写具体价格。若你更希望读者看到参考数字,可改为”机制 + 查询方法 + 标注核验日期”的版本——告诉我即可。