很多人看着账单里的「token」一头雾水:明明只问了三句话,怎么消耗了上万 token?这篇把计费规则一次讲透——token 怎么数、输入和输出为什么价格不同、对话为什么会「越聊越贵」,最后给你五个马上能用的省钱技巧。
token 怎么数?一个大概的换算
模型不是按「字」收费的,而是按 token——你可以把它理解成模型世界里的「字块」。粗略换算:中文 1 个字 ≈ 1~2 个 token,英文 1 个单词 ≈ 1~1.5 个 token。所以一段 500 字的提问,本身就带着几百上千 token 进场了。
容易被忽略的是:除你的提问外,系统提示词、历史对话、引用的文档全都要算进输入。账单里 token 比你说的字数多好几倍,通常就是这些「隐形开销」在起作用。
输入和输出,价格不一样
几乎所有模型都执行「输入便宜、输出贵」的双轨价,输出通常是输入的 3~5 倍。原因很简单:读入一批字(并行计算)很快,而一个字一个字往外蹦(逐个生成)要慢得多、算力花得多。
举个具体例子:假设某模型输入 1 元/百万 token、输出 4 元/百万 token。一次「你问 1000 字 + 它答 500 字」的对话,输入按 1000 字折算、输出按 500 字折算再乘 4——输出只占一半篇幅,却贡献了大头账单。这也解释了为什么让模型「长篇大论」比「简短回答」贵好几倍。
对话为什么越聊越贵?
多轮对话时,模型没有记忆,每次都要把全部历史消息重新发一遍。聊到第 10 轮,你发的 6 个字背后可能拖着前面九轮共几千 token 的包袱。这就是长对话「越聊越贵、越聊越慢」的根本原因。
同理,让模型读一份 50 页的 PDF 再提问,哪怕你只问一句「总结一下」,输入侧也是整份文档的 token 在计费。
五个马上能用的省钱技巧
- 控制输出长度:在提问里加「限 200 字以内回答」,输出降下来账单立竿见影;很多客户端还支持 max_tokens 硬上限。
- 长对话定期开新会话:话题换了自己就新建对话,别让几十轮历史一直跟着你计费。
- 文档只贴相关章节:让 AI 读整本书再问一个小问题,是最常见的浪费。
- 按场景选模型:日常问答用轻量模型(如 glm-5.3),复杂任务再上重型模型,同一件事花费可能差十倍。
- 善用带前缀的模型名:部分聚合平台同一模型有多条线路,价格可能不同,控制台的模型列表页标着单价,挑性价比高的用。
一句话总结:输入决定「底价」,输出决定「大头」,历史决定「加速度」。三个都管住,账单自然瘦下来。
常见问题
在哪里能看到一次调用花了多少 token?
控制台的「使用日志」里每条记录都有输入/输出 token 明细和折算金额,点开单条还能看到模型返回的用量字段,对账非常方便。
思考类模型的「思考过程」也收费吗?
收,而且按输出价计。推理模型会先生成大段内部推理再给你答案,这部分 token 同样计入输出——所以同等问题下思考模型明显更贵,简单任务别轻易用它们。
失败或中断的请求收费吗?
看断在哪:请求被拒(如参数错误、鉴权失败)不计费;模型已经生成了一部分的,已生成的输出 token 通常照常计费。所以写脚本时做好超时与重试,避免大量半截请求白花钱。