各家模型天天发榜单、刷分数,但榜单第一不代表人家在你业务里最好用。大模型评测这件事,得落到你自己的场景,而不是盯着别人的排名。把评测做成贴合业务的活,结论才真的用得上。榜单是别人的考场,你的业务才是你自己的考题。
快速结论
- 公开榜单考的是通用能力,未必贴合你的售后、写标题这类真实任务,只能当初筛。
- 自己攒几十到几百条真实输入输出做成评测集,比任何公开榜单都贴近需求。
- 评测按你的真实流量分布加权,别被整体平均分骗,最高频那类问题才是重点。
- 把价格算进评测,强模型处理难的、小模型处理易的路由组合往往最划算。
公开榜单的局限
榜单多考通用能力:解题、常识、代码。但你的业务是「用中文答售后问题」「给商品写标题」,和榜单场景差很远。一个榜单高分模型,可能在你的长尾问题上照样翻车。所以榜单只能当初筛,不能当结论,真正拍板要看你自己的场景表现。更糟的是榜单题目固定,模型方可能针对性优化,分数虚高,和你生产环境完全两回事。
自己做一版评测集
图:核心要点 核心要点(运营GO 整理)
| 看哪些指标 | 说明 | 怎么用 |
|---|---|---|
| 准确率 | 答案对不对,尤其事实类 | 事实题错一题就记,别只看整体 |
| 稳定性 | 同一类问题多次问结果波动 | 波动大说明不可信,慎用 |
| 格式遵循 | 要表格给表格、要列表给列表 | 对外输出常卡在这 |
| 拒编能力 | 资料没有时会不会硬编 | 没资料还编最危险 |
| 成本与速度 | 单次价格和响应时间 | 路由组合要一起算 |
看哪些指标才不会偏
准确率看答案对不对,尤其事实类;稳定性看同一类问题多次问结果波动大不大;格式遵循看要表格给表格、要列表给列表别自由发挥;坏问题表现是资料没有时会不会硬编。一个常见误判是只看「平均分最高」就定了模型,结果上线发现它在你们最高频的那类问题上偏偏弱。评测要按你的真实分布加权,你八成流量集中在某类问题,那类才是评测重点,不是均衡的全科分数。
定期复测与防泄漏
模型会更新,今天好用的下个版本可能变样;新模型也不断出。把评测做成定期的活:每季度拿同一套评测集跑一遍候选,决定要不要换或混用。评测集本身也是资产,越攒越值钱。评测集如果和训练数据高度重叠,分数会虚高,确保评测用的是模型从没见过的问题,最好来自真实业务日志,泄漏的评测只会让你误判,上线才发现问题。把评测集当成和代码一样长期维护的东西。
性价比要算总账
最贵的模型未必最划算。很多时候「强模型处理难的、小模型处理易的」这种路由组合,整体效果和成本都更优。评测时把价格因素一起算进去,你得到的不是「谁最强」,而是「谁在我的预算里最合适」。人工评判也不可替代,尤其是「答得合不合适」「语气对不对」这类主观项,定期抽看样本、记下手手感,是评测里最贵也最值的部分,别完全交给分数。路由不是比谁参数多,而是比谁在你的预算里最合适。
人工评判不可少
自动指标再全,也替代不了人看。尤其是「答得合不合适」「语气对不对」这类主观项,定期抽看样本、记下手感,是评测里最贵也最值的部分。别完全交给分数,分数高的样本也要抽看,避免模型学会「凑指标」而非真答对。建议每周固定抽看十到二十条,把这个手感变化记进评测集,人工反馈回流进去,下一轮评测才更准。
一个具体的评测样例
拿售后场景举例:从工单系统抽一百条真实客诉问答,让候选模型逐条答,人工标对错并记原因;再抽二十条长尾怪问题专看拒编能力——资料没有时会不会硬编。这套样本题量小但贴业务,比公开榜单一眼看出谁更适合你。每季度用同一百题复测,能直接看到版本之间谁退步了。
给模型分档而非只排名
评测结论别只排个一二三。更实用的是按任务分档:把「 쉬운高频问答」分给小模型,「复杂推理和长文写作」分给强模型,中间地带用路由。分档后你能直接算出每月账单,也知道哪类问题该升级模型、哪类该加规则。评测的价值不在那张分,而在这张分档表和它背后的成本账。新模型出来先塞进对应档位复测,不合适的就留在原地。
下一步行动清单
- 从业务日志里抽五十到两百条真实问题,配期望答案,建第一版评测集。
- 拿两到三个候选模型跑同一套题,按你的流量分布而非平均分排序。
- 把价格写进对比表,算强加小路由组合的总成本。
- 定个季度复测日历,新模型上线前先过你的评测集。
- 评测集按场景分组存档,避免和训练数据泄漏。


