要客观知道模型在你的业务上够不够好,得有自己的评测集。东拼西凑的题不说明问题,从真实场景出发建一套可复用的数据集,才是评测的地基。
快速结论
- 自建评测集要贴真实业务,而非用通用题凑数。
- 选题从高频和易错场景出发,覆盖典型与边缘。
- 打分要写清 rubric,人工与自动结合才稳。
- 数据集要持续维护,随业务和模型演变。
为什么不能只靠通用榜
公开榜单题是别人定的,重心在通用能力,和你每天要干的活常对不上。榜首模型在你场景翻车,一点也不稀奇。
要真知道哪个模型适合我,得用我的题测我的活。自建集是把评测从别人的标准拉回自己的业务,结论才用得上。
选题从哪来
最好的题源是真实:客服日志、用户提问、历史工单,挑出高频和易错的。真实题测出来的才是真水平,而非漂亮但脱离的样例。
还要覆盖两类:典型题看日常水平、边缘题(模糊、长、刁钻)看下限。只测典型,模型遇怪题露怯你却不知。
典型与边缘都要
典型题多来自高频请求,代表日常;边缘题来自异常和难例,代表风险。两套都进集,模型强弱才都被看见。
边缘题尤其值钱:它往往是出事的源头。把边缘当重点采集,评测才不只是平时还行,而是难时也稳。
标准答案怎么定
客观题(格式对不对、字段在不在)好判;主观题(逻辑、文风、策略)要写清评分标准。答案和标准分离,判分才不随意。
对开放题,可给参考答案加得分点,而非唯一解。定标的是给判分一把尺,尺度统一,不同人打的分才可比。
打分的 rubric
rubric 是评分细则:每分对应什么表现,边界在哪。写清它,人工判分才一致,自动判分才有据。rubric 质量是评测可信的命门。
避免感觉给分。把好的表现拆成可观察维度(准确、完整、合规、语气),逐维打分。维度清,分数才不是玄学。
人工与自动结合
能自动判的(格式、关键词、是否含某字段)用脚本跑,省时;需判质量的(文风、逻辑)抽样人工评,保真。两者结合又快又稳。
人工评也要按 rubric,不是凭印象。定期双人背靠背打分算一致性,分歧大就补 rubric。人工判分靠规矩才可信。
防数据泄漏
评测集若混进训练数据,分数虚高,自欺欺人。要严格隔离:评测题不进训练、不进公开、定期查重。隔离是评测诚实的底线。
还要防模型背题:用动态生成或定期换新题,避免模型靠记忆而不是能力得分。诚实的评测才指导得了决策。
规模与成本
集不必巨大,先小后大:几十到上百道真实题就能起步,跑通流程比造大集重要。规模随需求长,别为全而拖。
维护也要算成本:标注、复核、更新都花钱。把集当资产经营,投入和它对决策的贡献匹配,而非无限堆题。
版本化管理
评测集自己也要版本化:加了什么题、改了什么标准,留记录。不同版本分数不可直接比,要同版对比才公平。
模型升级后跑同一版集,分数涨跌才有意义。版本化让评测可复现、可追踪,是评测从一次性变常态的关键。
和模型选型的衔接
自建集直接服务选型:把候选模型跑同一集,多维度对比,谁适合哪类任务一目了然。评测集是选型的裁判。
还能指导提示词和微调:哪类题掉分,就针对性改提示或补数据。评测集不只是打分,更是优化的指南针。
常见三个坑
坑一:题源脱离真实,测了等于白测。坑二:rubric 不清,人工分不可比。坑三:评测集混入训练,分数虚高。
三者都靠真实选题、写清 rubric、严格隔离化解。评测集的价值在诚实与贴合,不是题多。
边缘题怎么造
边缘题可从失败案例反推:模型答错的、用户投诉的,提炼成题。失败是最好的出题人,它暴露的弱点正该被考。
也可刻意构造:长输入、歧义、诱导、跨语言。把容易翻车的情形系统化成题,评测才专戳软肋,而非只考送分题。
和在线监控的关系
离线评测集看该不该上,在线监控看上线后稳不稳。两者互补:离线把关、在线守日常。评测集是监控的基准线。
线上发现的新型错误,回流成新题进集,集随真实 evolves。离线在线打通,评测才活,而非一造了之。
衡量评测集本身好不好
看两件事:题是否覆盖真实高低频与边缘、分数是否能区分模型优劣。能区分、能贴合,说明集立得住。
再看它是否驱动了决策:选型、改提示、补数据是否真参考了它。评测集的价值不在漂亮,在被用、能信、能指导。
小团队轻量起步
别一上来建平台。一份表格加几十道真实题就能起步:每行一题一标准一 rubric,跑模型后人工或脚本判分,版本用表格历史管。轻量才容易坚持。
等流程跑顺、题量上来再脚本化。小团队的优势是快,用最低成本把自建评测这件事先转起来,比造大系统更可能活下来。
图:自建评测集 核心要点(运营GO 整理)
| 步 | 做什么 | 易错 |
|---|---|---|
| 选题 | 贴真实 | 脱离 |
| 定标 | 写 rubric | 凭感觉 |
| 隔离 | 不进训练 | 混数据 |
延伸阅读:什么是 Prompt(提示词)、什么是 MCP(模型上下文协议)。
下一步行动清单
- 题源取自真实高频与易错。
- 典型与边缘题都要覆盖。
- 打分写清 rubric 不凭感觉。
- 评测集与训练严格隔离。
- 线上错误回流成新题。


