挑模型的时候,最容易犯的错是只盯着一个数字看:要么只看价格,挑最便宜的;要么只看榜单,挑分数最高的。真跑起业务来才发现,最便宜的那个慢得让人等不起,分数最高的那个贵得用不起。这篇把价格、速度、上下文这三件事拆开讲,给你一套能直接照着用的权衡方法。
先把三个维度说清楚
第一个维度是价格。模型计费按输入和输出分别算,输出通常比输入贵几倍。这意味着同样一段话,让它「读」和让它「写」的成本差很多——如果你的任务只是分类、抽取、判断,成本会比写文章低一个量级。
第二个维度是速度。速度分两种:首字延迟和生成速度。前者决定用户按下回车后要等多久才看到第一个字,后者决定答案吐得有多快。交互式场景对首字延迟敏感,后台批处理反而更在乎总吞吐。
第三个维度是上下文长度。它决定了单次请求能塞进多少内容,直接影响你能处理多长的文档、能保留多长的对话。上下文越大通常越贵,而且部分模型超过某个长度会整体涨价,不是线性加价。
记住这三者的关系:快、便宜、能装,通常只能同时拿到两个,第三个要靠任务设计去补。
同价位怎么横评:三步走
第一步,把你的真实任务压缩成一段 100 到 300 字的样例。不要拿「你好,请介绍一下自己」这种题去测,那测不出差别。要用你日常最多的那类请求,比如一段产品描述改写、一份合同条款抽取、一次代码修复。
第二步,把这段样例拆成固定输入和可变输出。固定输入部分是每次都要发过去的(提示词、背景资料、few-shot 示例),这部分成本是刚性的;可变输出部分才是你真正需要控制的。很多人优化成本只优化输出,其实输入里堆着的冗余提示词更值得先砍。
第三步,同一条样例跑三个价位档:低价档、中价档、高价档各挑一个。记录四件事——是否一次答对、需要返工几轮、耗时多少、单次花费多少。把「返工轮数」乘进去算总账,你会发现有些便宜模型在难任务上反而更贵。
这一步的关键在于别只看单价。单价便宜但每三次要重问一次,折算下来真实成本可能是单价的两三倍;反过来,贵模型一次答对,省下的返工轮数和你的等待时间,往往比差价更值钱。
按任务类型套模板
分类、打标、抽取这类「答案唯一且短」的任务,优先选低价快模型。这类任务对推理深度要求不高,但量大,单价差一毛就是几百块的差距。
写作、总结、翻译这类「输出即产品」的任务,建议中价档起步。低价档在这类任务上常见的问题是语气飘、结构散,改起来比自己写还费事。
代码、数学、复杂推理这类「一步错步步错」的任务,值得上高价档。这类任务的特点是错误会级联,第一句想歪了后面全废,用便宜模型省下的钱很容易被返工吃掉。
长文档理解是独立一类。它既要长上下文,又常常只需要简短结论,属于「输入巨大、输出很小」的形态。这类任务的关键动作是先做一轮粗筛分块,再把最相关的片段送给模型,而不是整本塞进去。
常见问题
最贵的模型一定效果最好吗?
不一定。价格大体反映的是模型的规模和推理开销,但具体效果高度依赖任务匹配度。有些模型擅长长文理解,有些擅长代码,有些在小任务上反而因为«想太多»而变慢。选型的正确姿势是先按任务类型缩小范围,再在同价位里比。
怎么估算一个月的总花费?
用你抽样的那段真实样例,量出平均输入长度和平均输出长度,再乘以日均请求数。注意把返工轮数算进去——最终账单反映的是「实际请求数」,不是你计划里的请求数。留 30% 的余量比较稳妥。
能不能便宜模型打底、贵模型兜底?
可以,这是很实用的组合。让低价模型先跑一遍,对结果做一次自检或打分,不确定的样本再转给高价模型。多数业务里,真正需要「重炮」的样本只占一小部分,这样组合能把整体成本压下来一大截。