首页 / 教程 / 进阶技巧

token 是怎么计费的?输入输出差价与省钱技巧

很多人看着账单里的「token」一头雾水:明明只问了三句话,怎么消耗了上万 token?这篇把计费规则一次讲透——token 怎么数、输入和输出为什么价格不同、对话为什么会「越聊越贵」,最后给你五个马上能用的省钱技巧。

token 怎么数?一个大概的换算

模型不是按「字」收费的,而是按 token——你可以把它理解成模型世界里的「字块」。粗略换算:中文 1 个字 ≈ 1~2 个 token,英文 1 个单词 ≈ 1~1.5 个 token。所以一段 500 字的提问,本身就带着几百上千 token 进场了。

容易被忽略的是:除你的提问外,系统提示词、历史对话、引用的文档全都要算进输入。账单里 token 比你说的字数多好几倍,通常就是这些「隐形开销」在起作用。

输入和输出,价格不一样

几乎所有模型都执行「输入便宜、输出贵」的双轨价,输出通常是输入的 3~5 倍。原因很简单:读入一批字(并行计算)很快,而一个字一个字往外蹦(逐个生成)要慢得多、算力花得多。

举个具体例子:假设某模型输入 1 元/百万 token、输出 4 元/百万 token。一次「你问 1000 字 + 它答 500 字」的对话,输入按 1000 字折算、输出按 500 字折算再乘 4——输出只占一半篇幅,却贡献了大头账单。这也解释了为什么让模型「长篇大论」比「简短回答」贵好几倍。

对话为什么越聊越贵?

多轮对话时,模型没有记忆,每次都要把全部历史消息重新发一遍。聊到第 10 轮,你发的 6 个字背后可能拖着前面九轮共几千 token 的包袱。这就是长对话「越聊越贵、越聊越慢」的根本原因。

同理,让模型读一份 50 页的 PDF 再提问,哪怕你只问一句「总结一下」,输入侧也是整份文档的 token 在计费。

五个马上能用的省钱技巧

一句话总结:输入决定「底价」,输出决定「大头」,历史决定「加速度」。三个都管住,账单自然瘦下来。

常见问题

在哪里能看到一次调用花了多少 token?

控制台的「使用日志」里每条记录都有输入/输出 token 明细和折算金额,点开单条还能看到模型返回的用量字段,对账非常方便。

思考类模型的「思考过程」也收费吗?

收,而且按输出价计。推理模型会先生成大段内部推理再给你答案,这部分 token 同样计入输出——所以同等问题下思考模型明显更贵,简单任务别轻易用它们。

失败或中断的请求收费吗?

看断在哪:请求被拒(如参数错误、鉴权失败)不计费;模型已经生成了一部分的,已生成的输出 token 通常照常计费。所以写脚本时做好超时与重试,避免大量半截请求白花钱。

边看边练,效果最好

注册即可创建密钥,OpenAI 兼容接口,本文所有示例直接可用。

留言交流

有问题、有补充,写两句吧~留言会实时显示在下方(无需注册)。

留言加载中…
← 上一篇:API 令牌与额度管理 下一篇:API 报错排查手册 →