科技与AI
CAISI提出AI测量科学研究议程:从测量效度、结果解读到实地测量的三类难题
CAISI发文提出AI测量科学三大挑战领域
NIST下属人工智能标准与创新中心CAISI在2025年12月2日发表研究博客,由Drew Keller、Ryan Steed、Stevie Bergman与应用系统团队署名,提出一套AI测量科学的研究议程,核心判断是要有一流的AI系统,先得有一流的AI测量方法。文章把难题分成三类。第一类是测量效度,涉及构念效度、结果能否外推、基准如何设计以及测量工具本身的创新,作者指出很多评测既没讲清楚自己到底在测什么,也没有严格验证测量结果。第二类是结果与主张的解读,包括如何表达不确定性、如何设定合理基线、如何在模型间比较以及报告规范,文中提到不少评测连误差棒这类最基本的不确定性表达都没有。第三类是实地测量,关注部署之后的评估、下游结果的量度和相关方意见的纳入。文章说明这项工作服务于美国AI行动计划,该计划要求NIST牵头发展衡量与评估AI模型的科学。
评测是AI产业公认的软肋,但很少有机构把问题拆到方法论这一层。CAISI点名的两处硬伤——不说清测什么、不给不确定性——恰好是当前榜单被反复质疑的原因。这套议程写在官方渠道,后续NIST的评测规范有可能沿这条线索展开,厂商的自评报告也会更容易被拿这些标准衡量。
短期不改变任何产品,但会影响评测报告的形态:给出误差范围、说明基线、交代构念,有可能从加分项变成基本要求。对采购和监管一侧,这套框架提供了一份现成的质询清单,用来判断厂商给出的分数值不值得信。
后续关注
关注CAISI后续是否把三类难题落成具体的评测指南或技术文件,以及AITE等评测项目的结果报告是否按这套框架披露不确定性。
信息来源
GFT Finance 整理归纳公开信息并总结要点,不构成投资建议。数据以来源原文为准。