跑分是考试,认证是上岗证——AI评价体系的范式转移
导语: 当一个AI模型在MMLU上考了90分、在HumanEval上考了85分、在GSM8K上考了92分,我们能否因此断定它是一个“可信赖”的AI?专知智库发布《AI技能认证白皮书》,给出明确答案:跑分高不等于可信赖。跑分是“考试”,认证是“上岗证”。
正文:
AI产业正在经历一场深刻的评价危机。跑分衡量的是“模型在固定题库上的得分”,可信赖衡量的是“模型在真实任务中的决策能力、安全边界和责任可追溯性”。两者之间隔着一条巨大的鸿沟。
跑分的三大局限。 第一,可刷分——模型可以针对题库优化,甚至污染训练数据,使跑分虚高。第二,静态化——跑分使用静态题库,无法反映真实世界的动态变化。第三,无责任——跑分低不影响任何后果,跑分与责任脱钩。
跑分信任危机的四个表现。 跑分虚高——分数上涨但能力停滞;跑分饱和——头部模型分数趋同,区分度丧失;体验脱节——跑分高不等于好用;责任脱钩——跑分与责任无关联。
从“考试”到“上岗证”的跃迁。 考试测试知识——你知不知道这个事实?上岗证测试能力——你能不能做这个工作?考试是一次性的,上岗证是持续性的;考试是标准化的,上岗证是个性化的;考试是无责任的,上岗证是有责任的。
AI技能认证正是“从考试到上岗证”的范式转移。它不定义“AI有多强”,它定义“AI如何可信”。它从“知识评价”走向“能力评价+信任评价+责任评价”,为AI产业从“早期探索”走向“规模爆发”提供关键基础设施——没有信任,就没有规模;没有认证,就没有信任。
专知智库的使命,是推动AI评价从“跑分”走向“认证”,从“考试”走向“上岗证”,从“强度”走向“可信度”。让AI不仅“能跑”,而且“可信”。





