打开模型列表几百个名字,第一反应往往是「随便挑一个贵的总没错」——结果要么贵得没必要,要么大材小用。选模型正确的姿势不是比谁最强,而是先问「我要做什么任务」,再按任务类型对号入座。这张对照表覆盖最常见的五类场景,照着选基本不会踩坑。
选型对照表:任务 → 模型
日常问答、翻译、文案润色这类轻任务,用快而便宜的模型就够了,比如 glm-5.3-flash、qwen3.8-flash——响应快、单价低,质量对轻任务完全够用。写代码、深度分析、复杂推理,换推理能力强的 deepseek-v4.1-flash 或 kimi-k3,这类任务模型之间的差距是真实存在的,值得多花一点。看图、读截图、图表理解属于多模态任务,选带 vision 能力的模型(如 gpt-5.6-sol)。超过 10 万字的长文档,直接上长上下文的 doubao-seed-2-1-turbo,别用普通模型硬塞。批量跑几百上千条简单任务(分类、打标签、格式转换),回到最便宜的 flash 系模型,成本能差出十倍以上。
一句话口诀:轻任务用 flash 系,重活找推理系,看图认准 vision,长文交给长窗口,批量大锅饭谁便宜用谁。
三个容易被忽略的选型细节
第一,贵不等于对。旗舰模型处理「把这段话翻译成英文」这种任务,输出质量和 flash 系几乎没差别,但你为每个字付的钱可能是好几倍——预算烧在刀刃上才有意义。第二,注意模型的上下文窗口和最大输出限制:长文摘要要看输入上限,生成万字长文要看输出上限,这两项在模型列表页都有标注。第三,同一任务可以先小规模试跑再定型:拿 20 条真实样本分别喂给两个候选模型对比效果,比看任何评测文章都靠谱,试跑成本通常不到 1 块钱。
常见问题
能不能一直用一个模型不换?
可以,用 glm-5.3-flash 这类均衡模型当默认款,遇到明显搞不定的任务再针对性换强模型,是成本和质量最省心的平衡。大多数人的实际用法就是「一主一备」加一个专项模型。
模型列表里的价格怎么比较?
站内价格按「每百万 token」计价,同样的任务量直接乘一下就能算出差距。挑同档模型时,优先看单位价格和上下文窗口的乘积性价比,而不是单看谁便宜。
模型会下线吗?选型要不要留后手?
模型列表是动态更新的,偶尔会有模型调整。写代码时别把模型名写死在业务里,做成配置项,换模型改一行配置就行,成本几乎为零。