自建 AI 评测数据集:从选题到打分的实操

运营GO 编辑部

要客观知道模型在你的业务上够不够好,得有自己的评测集。东拼西凑的题不说明问题,从真实场景出发建一套可复用的数据集,才是评测的地基。

快速结论

  • 自建评测集要贴真实业务,而非用通用题凑数。
  • 选题从高频和易错场景出发,覆盖典型与边缘。
  • 打分要写清 rubric,人工与自动结合才稳。
  • 数据集要持续维护,随业务和模型演变。

为什么不能只靠通用榜

公开榜单题是别人定的,重心在通用能力,和你每天要干的活常对不上。榜首模型在你场景翻车,一点也不稀奇。

要真知道哪个模型适合我,得用我的题测我的活。自建集是把评测从别人的标准拉回自己的业务,结论才用得上。

选题从哪来

最好的题源是真实:客服日志、用户提问、历史工单,挑出高频和易错的。真实题测出来的才是真水平,而非漂亮但脱离的样例。

还要覆盖两类:典型题看日常水平、边缘题(模糊、长、刁钻)看下限。只测典型,模型遇怪题露怯你却不知。

典型与边缘都要

典型题多来自高频请求,代表日常;边缘题来自异常和难例,代表风险。两套都进集,模型强弱才都被看见。

边缘题尤其值钱:它往往是出事的源头。把边缘当重点采集,评测才不只是平时还行,而是难时也稳。

标准答案怎么定

客观题(格式对不对、字段在不在)好判;主观题(逻辑、文风、策略)要写清评分标准。答案和标准分离,判分才不随意。

对开放题,可给参考答案加得分点,而非唯一解。定标的是给判分一把尺,尺度统一,不同人打的分才可比。

打分的 rubric

rubric 是评分细则:每分对应什么表现,边界在哪。写清它,人工判分才一致,自动判分才有据。rubric 质量是评测可信的命门。

避免感觉给分。把好的表现拆成可观察维度(准确、完整、合规、语气),逐维打分。维度清,分数才不是玄学。

人工与自动结合

能自动判的(格式、关键词、是否含某字段)用脚本跑,省时;需判质量的(文风、逻辑)抽样人工评,保真。两者结合又快又稳。

人工评也要按 rubric,不是凭印象。定期双人背靠背打分算一致性,分歧大就补 rubric。人工判分靠规矩才可信。

防数据泄漏

评测集若混进训练数据,分数虚高,自欺欺人。要严格隔离:评测题不进训练、不进公开、定期查重。隔离是评测诚实的底线。

还要防模型背题:用动态生成或定期换新题,避免模型靠记忆而不是能力得分。诚实的评测才指导得了决策。

规模与成本

集不必巨大,先小后大:几十到上百道真实题就能起步,跑通流程比造大集重要。规模随需求长,别为全而拖。

维护也要算成本:标注、复核、更新都花钱。把集当资产经营,投入和它对决策的贡献匹配,而非无限堆题。

版本化管理

评测集自己也要版本化:加了什么题、改了什么标准,留记录。不同版本分数不可直接比,要同版对比才公平。

模型升级后跑同一版集,分数涨跌才有意义。版本化让评测可复现、可追踪,是评测从一次性变常态的关键。

和模型选型的衔接

自建集直接服务选型:把候选模型跑同一集,多维度对比,谁适合哪类任务一目了然。评测集是选型的裁判。

还能指导提示词和微调:哪类题掉分,就针对性改提示或补数据。评测集不只是打分,更是优化的指南针。

常见三个坑

坑一:题源脱离真实,测了等于白测。坑二:rubric 不清,人工分不可比。坑三:评测集混入训练,分数虚高。

三者都靠真实选题、写清 rubric、严格隔离化解。评测集的价值在诚实与贴合,不是题多。

边缘题怎么造

边缘题可从失败案例反推:模型答错的、用户投诉的,提炼成题。失败是最好的出题人,它暴露的弱点正该被考。

也可刻意构造:长输入、歧义、诱导、跨语言。把容易翻车的情形系统化成题,评测才专戳软肋,而非只考送分题。

和在线监控的关系

离线评测集看该不该上,在线监控看上线后稳不稳。两者互补:离线把关、在线守日常。评测集是监控的基准线。

线上发现的新型错误,回流成新题进集,集随真实 evolves。离线在线打通,评测才活,而非一造了之。

衡量评测集本身好不好

看两件事:题是否覆盖真实高低频与边缘、分数是否能区分模型优劣。能区分、能贴合,说明集立得住。

再看它是否驱动了决策:选型、改提示、补数据是否真参考了它。评测集的价值不在漂亮,在被用、能信、能指导。

小团队轻量起步

别一上来建平台。一份表格加几十道真实题就能起步:每行一题一标准一 rubric,跑模型后人工或脚本判分,版本用表格历史管。轻量才容易坚持。

等流程跑顺、题量上来再脚本化。小团队的优势是快,用最低成本把自建评测这件事先转起来,比造大系统更可能活下来。

核心要点选题贴真场景采集真实题打分rubric 清维护常更新

图:自建评测集 核心要点(运营GO 整理)

做什么易错
选题贴真实脱离
定标写 rubric凭感觉
隔离不进训练混数据

延伸阅读:什么是 Prompt(提示词)什么是 MCP(模型上下文协议)

下一步行动清单

  • 题源取自真实高频与易错。
  • 典型与边缘题都要覆盖。
  • 打分写清 rubric 不凭感觉。
  • 评测集与训练严格隔离。
  • 线上错误回流成新题。

相关阅读