Token 与计费逻辑:你付的 API 费到底花在哪
一句话结论:输入输出分开计价,账单滚雪球;贵在长上下文与循环
读之前建议先懂: 上下文窗口:AI 的"工作记忆"为什么有限,又为什么越来越不够用
📌 本页有意不写任何具体价格。价格按月变动,写死的数字会在几周内变成误导——本页只讲计费机制与省钱杠杆。做采购决策前,请查各厂商官方定价页。
当前判断
- 贵不在单次问答,贵在高频、长上下文、全自动三类场景。
- 三条省钱杠杆:砍上下文 > 模型分级 > 控制输出。
- Agent 循环是成本放大器:20 步任务轻松百倍消耗。
一句话结论
API 按 Token 收费,且输入(提示)和输出(回答)分开计价——你的钱 = 每一轮都重新发送的全部上下文 × 输入单价 + 生成的回答 × 输出单价。长对话越来越贵,是因为账单是”滚雪球”式的。
逻辑链
模型按 Token 处理文本(见 01-llm是如何思考的)→ API 每次调用都要重发全部历史(见 02-上下文窗口)→ 输入 Token 随对话轮次累积增长 → 费用 ≈ Σ(每轮的上下文长度) × 输入价 + 输出长度 × 输出价 → 所以”聊得越久、贴得越多、Agent 循环越多”,成本超线性上涨
展开
1. 三条省钱的杠杆(按效果排序)
- 砍上下文:定期让 AI 总结结转、丢弃无关历史——直接砍掉最大的成本项
- 模型分级:简单任务(改写/分类/摘要)用小模型,难题才用旗舰模型;不同档位模型的单位价差可达一个数量级以上
- 控制输出:明确要求”50 字内""只列要点”——输出单价通常显著高于输入单价(具体倍数随模型与时期变化,以官网为准)
2. 为什么 Agent 贵
Agent 每一步循环都带着全部历史 + 工具返回的大段内容再跑一遍模型(见 06-Agent的逻辑)。一个 20 步的 Agent 任务,Token 消耗轻松是普通对话的百倍。用 Agent 前先问:这个任务的产出值多少钱?
3. 换算手感
不写具体数字,只给可复用的手感:把 Token 想成”字数”,把上下文想成”每轮都要重交一遍的作业”。于是成本 = 作业长度 × 交的轮数。真正要盯的不是单次问答(单次极便宜),而是高频 × 长上下文 × 全自动这三件事叠在一起的场合——它们才是账单失控的地方。需要数字时请查厂商官网定价页。
决策规则
| 条件(IF) | 动作(THEN) |
|---|---|
| 成本超预期 | 按顺序砍:上下文 → 模型档位 → 输出长度(顺序即效果排序) |
| 要上 Agent / 自动化 | 先设预算熔断(超 X 元自动停),再谈能力 |
| 只是日常问答 | 用网页版订阅即可,不必上 API |
常见误区
- ❌ “包月会员 = API 计费” —— 订阅制(如网页版会员)与 API 是两套账;重度自动化用户往往 API 更可控
- ❌ “缓存就是省钱开关” —— 上下文缓存确实能降重复输入的成本,但只在”前缀重复高”的场景有效
- ❌ “免费工具没有成本” —— 免费通常意味着你的数据被用于改进服务或其他变现,成本只是换了形态
现在就能做的事
- 把你最频繁的一个 AI 用法按”输入长度 × 频次”粗算一遍月成本,判断该不该用 API + 小模型替代
- 给自己的 Agent 任务设”预算熔断”:超过 X 元自动停(护栏意识,见 06-Agent的逻辑)
相关页面
- 01-llm是如何思考的 / 02-上下文窗口 — 计费的机制根源
- 06-Agent的逻辑 — 成本放大器
- 10-AI工具选型五步法 — 第 4 步”总拥有成本”用到这里的手感
出处与置信度
| 引用点 | 出处 | 类型 | 核验 |
|---|---|---|---|
| Token 是处理与计费单位、输入/输出分开计价、每轮重发全部上下文 | 由 01-llm是如何思考的(Token 化)+ 02-上下文窗口(每轮读入全部上文)推导 | [推导] | ✅ 机制稳定 |
| 上下文缓存只对”前缀重复高”的场景有效 | 各厂商官方缓存定价说明 | [官方文档] | ⚠️ 待核验:规则随厂商而变 |
| 具体价格、模型档位价差 | 各厂商官方定价页 | [官方文档] | ⚠️ 待核验(有意不写):本页只讲机制 |
策略说明(待站长确认):本页刻意不写具体价格。若你更希望读者看到参考数字,可改为”机制 + 查询方法 + 标注核验日期”的版本——告诉我即可。