
为什么“每百万 token 多少钱”不够用
很多大模型评测文章喜欢列出输入价格、输出价格和上下文长度,这些数据当然有用,但它们并不能直接告诉企业应该选择哪个模型。生产环境里,一次任务的成本可能包括多轮重试、知识库检索、工具调用、数据库查询、人工修改、失败后的返工和基础设施。一个单价更低的模型,如果经常答错或需要人工重写,最终的“每个正确结果成本”可能反而更高。
因此,模型比较应该从 token 价格升级到任务结果。你不是在购买一串文字,而是在购买一项工作是否被正确完成。对于客服,是问题是否被准确分流;对于销售,是线索是否被整理成可用记录;对于研究,是结论是否有可靠引用;对于代码,是测试是否通过且没有引入新风险。
先定义什么叫“完成”
评测失败的第一原因,通常不是模型不够强,而是团队没有把成功标准说清楚。一个“生成产品介绍”的任务,什么叫好?语法正确不代表信息完整,信息完整也不代表符合品牌规范。一个“分析客户流失”的任务,答案听起来合理不代表数据和指标使用正确。
建议为每个任务建立一页验收规则,至少包含五个维度。第一是正确性,关键事实不能错。第二是完整性,必须回答哪些信息,缺什么要主动说明。第三是证据,结论是否可以追溯到提供的资料。第四是格式,是否能被下游系统解析或直接使用。第五是安全,是否遵守权限、隐私和业务边界。不同任务可以调整权重,但不能只凭主观印象说“这个更聪明”。
评测集要来自真实工作,而不是只来自网上题库
公开 benchmark 能反映通用能力,却不一定反映你的业务。企业应该收集过去真实出现过的问题,做脱敏和分类,形成一套持续更新的评测集。样本至少覆盖正常请求、难例、资料缺失、格式错误、边界请求、恶意指令和需要转人工的场景。
不要只收集成功案例。失败样本更有价值,因为它们告诉你系统在什么地方会崩溃。可以把样本按错误类型标记:知识缺失、检索不到、理解错误、格式不对、工具失败、权限越界、幻觉和成本超限。每次模型升级,都用同一套核心样本做回归测试,再增加一小部分新样本,避免结果随意变化。
评测完整轨迹,而不是最后一句话
在 Agent 或工具调用场景中,模型最后给出正确答案,并不说明过程可靠。它可能调用了错误工具,访问了不该看的资料,重复执行了动作,或者在多次错误后偶然得到正确结果。真正的生产评测,应该把调用轨迹一起记录下来。
需要观察模型调用了几次工具、每次参数是否正确、返回结果是否被理解、是否重复检索、是否在权限被拒绝后继续尝试、是否在不确定时主动说明。可以将轨迹成本和结果质量放在一张表里,比较“正确但昂贵”“正确且高效”“错误但便宜”“错误且高风险”四种情况。
对于代码 Agent,还要评测改动范围、测试通过率、静态检查、安全扫描、依赖变化和人工 review 时间。对于内容 Agent,要评测事实、重复度、品牌语气、引用和编辑修改。不同场景需要不同量尺,不能拿一个通用分数覆盖所有产品。
成本应该按“可接受结果”计算
可以把任务总成本拆成几部分:模型调用、检索与存储、工具和执行环境、失败重试、人工审核和返工。然后计算三种数字:每次尝试成本、每个完成任务成本、每个被业务接受结果成本。最后一个数字最接近真实经营情况。
举例来说,一个低价模型每次调用只要几分钱,但错误率较高,平均需要两次重试和三分钟人工修改;另一个模型单价更高,却可以一次完成、引用更完整,员工几乎不修改。对于高频任务,前者未必更省钱。反过来,对于简单分类和批量清洗,高能力模型可能属于过度配置。因此,成本判断必须结合任务数量、风险和人工价格。
路由策略是评测结果的实际用法
评测不应该停在报告里,而要变成模型路由规则。简单、重复、结构固定的任务,优先选择速度快且价格低的模型;需要复杂推理、长资料理解或最终审核的任务,才使用更强模型;涉及付款、法律结论、重大客户承诺的任务,哪怕模型分数很高,也应该保留人工确认。
路由可以由规则、分类模型或小型判断器完成。先判断任务类型、风险、长度和时效,再决定模型档位和是否需要检索。对于不确定的请求,可以先用便宜模型做分类,再升级给高能力模型。这样既能控制成本,也能让高端能力集中在真正有价值的位置。
不要把数据问题误判成模型问题
当答案错误时,很多团队第一反应是换模型。但错误可能来自资料过期、切分不合理、检索排序错误、权限过滤缺失、提示词不清楚或工具返回异常。模型只是整个链路的一环。
排查时建议做对照实验:不接检索时模型表现如何?只提供正确资料时是否改善?固定提示词换模型是否改善?换成结构化工具返回是否改善?增加人工确认后错误是否减少?只有把变量拆开,才能知道应该改数据、流程还是模型。盲目追逐更贵版本,往往不能解决根因。
生产评测要有版本和门槛
模型、提示词、知识库和工具都应该有版本号。上线前设置最低门槛,例如关键事实正确率不低于某个值、权限违规为零、平均成本不超过预算、P95 延迟不超过目标。任一核心指标下降,就暂缓全量发布。
每次升级后,除了看平均分,还要看最差样本。平均质量提升一点,但出现一个新的高风险错误,可能不值得上线。可以建立“阻断型错误”清单,例如泄露隐私、错误执行写操作、虚构政策、绕过审批和对外发布未经审核内容,这些问题应当拥有最高优先级。
小白也能做的模型实测
如果你不是工程师,可以选择一个自己每天都做的任务,例如整理会议纪要、总结课程、分析商品评论或生成文章大纲。准备十条真实样本,分别给两三个模型,要求它们使用相同资料和格式。记录每条结果是否事实正确、你改了多少、花了多久、是否愿意把它交给别人使用。
持续做一周,你会得到比“网上哪个模型第一”更有意义的答案。你也会发现,很多任务并不需要最强模型,真正需要的是清晰的输入、固定的模板、可靠的资料和一个方便修改的界面。
对 AI 内容和工具平台的启发
平台在介绍模型时,不要只写版本号和宣传词,而应该帮助读者做选择:这个模型适合什么任务,不适合什么任务,输入数据如何保护,费用如何估算,结果应该如何检查。这样的内容更容易获得搜索流量,也更容易形成信任,因为它解决的是读者实际遇到的决策问题。
对企业服务来说,模型评测报告也可以成为交付物。客户不只得到一个“推荐模型”,还应该得到测试样本、验收指标、路由规则、成本估算和升级流程。这样当供应商或版本变化时,客户仍然拥有自己的判断能力。
总结
大模型选型不是一次性的采购,而是一套持续评测和运营。真正应该比较的是单位正确结果成本、延迟、稳定性、人工修改、风险和可维护性。用真实任务建立评测集,把结果变成路由规则,再用版本和门槛保护生产质量,才能让模型能力真正带来业务收益。