24小时热门版块排行榜    

查看: 50  |  回复: 0

盈科AI

新虫 (初入文坛)

[交流] NIST推进盲测评估平台:科研大模型选型的新标尺来了

当每个模型厂商都说自己"最强"的时候,我们需要一个中立的裁判。

一、为什么我们需要"盲测"?
大模型时代,有一个让人头疼的问题:到底哪个模型更好?

你去看每个厂商的发布会,都说自己在某某基准上拿了第一。但你仔细一看,测试集不一样、评测方法不一样、甚至连"第一"的定义都不一样。

更严重的问题是数据污染--很多基准测试集的答案,早就被模型在训练的时候"见过"了。就像考试前提前拿到了卷子,考分再高也说明不了真实水平。

据报道,NIST(美国国家标准与技术研究院)正在推进一项用"盲数据"来评估AI模型的计划,旨在为这个问题提供更可信的答案。

二、盲测平台是什么?为什么重要?
据报道,NIST 正在推进一项AI模型盲测评估计划。核心就一个词:盲测。

具体来说:

NIST 提供一个隔离的测试环境,里面的数据是"封存"的--别人拿不到,模型不可能在训练时见过
模型提供者把自己的模型提交上去,在这些盲数据上跑任务
大家用同样的数据、同样的指标、同样的方法测,结果才有可比性
NIST 的目标很明确:降低训练/测试数据污染的风险,确保评估的严谨性和客观性。

据现有信息,首批任务可能聚焦视觉语言模型(VLM)领域,涵盖科学和公共安全方向的图像分析任务。

据报道,该计划的设计是双向的--数据提供者可以提交自己领域的数据集(别人看不到),模型提供者可以提交自己的模型(在盲数据上测)。两边各取所需:数据提供者知道了哪些模型在自己的数据上表现好,模型提供者知道了自己在更多任务上的真实水平。

三、体系化评估框架:不只是跑分
此外,NIST 还在推进AI系统评估方法论方面的工作,据称涉及测试、评估、验证、确认等环节的体系化框架,有望面向公众征求意见。

TEVV 是什么?测试(Test)、评估(Evaluation)、验证(Verification)、确认(Validation)--简单说,就是怎么科学地评估一个AI系统到底行不行。

据报道,该框架的核心思想是:AI系统的评估不能只靠跑分,要有一套完整的方法论。

它提出了一个四阶段的方法:

明确目标--你要评估什么?安全性?准确性?公平性?不同的目标有不同的测法
设计评估--用什么数据?什么指标?什么流程?
执行评估--实际跑测试、收集数据
分析结果--数据说明了什么?有什么局限?下一步怎么做?
听起来好像很简单,但实际上很多企业和机构的AI评估就是"跑个基准,贴个分数",根本没有体系化的方法。NIST 要做的,就是给大家一个参考标准。

据报道,这个框架覆盖的范围很广:统计机器学习模型、大语言模型、多模态模型、Agent系统……几乎所有AI技术都能用。

四、对科研场景的实际意义
NIST 这两个动作,对科研领域选大模型有什么影响?

1. 以后选型有了中立参考
现在科研机构选大模型,基本靠"听谁说得好"或者"自己试一下"。前者不客观,后者成本高。

等盲测平台跑起来,有了盲测数据,至少在首批覆盖的领域,大家有了一个相对客观的参考--不是厂商自己说的"我们模型最棒",而是中立第三方在盲数据上测出来的真实成绩。

评估方法有了标准

NIST 推进的评估框架虽然还在草案阶段,但 NIST 出的东西,后续有可能变成行业通行的做法。

以后科研机构采购AI系统,很可能会要求厂商按照体系化评估方法提供评估报告,而不是随便丢几个基准分数就完事。

3. 垂直领域模型的机会来了
首批任务据称是垂直领域的专业任务。这对深耕特定领域的模型是好事--通用大模型什么都懂一点,但在专业领域的图像分析上,不一定比专门训练的垂直模型强。

盲测环境下,是骡子是马拉出来遛遛,靠的是真本事,不是营销话术。

五、但也要冷静看待
当然,我们也不能对这个盲测计划期望过高。

第一,覆盖范围有限。 据目前信息,首批任务以VLM图像分析为主。科研场景最常用的文本理解、文献综述、代码生成这些能力,暂时可能还不在范围内。要覆盖到科研人员关心的所有维度,还需要时间。

第二,参与是自愿的。 该计划据称是"自愿参与"的,不是强制认证。大厂商愿不愿意把自己的模型送去测、测了愿不愿意公开结果,都是未知数。

第三,盲数据不等于完美。 隔离环境能降低数据污染的风险,但不能完全消除。而且"盲"到什么程度、数据质量怎么样,这些都会影响结果的可信度。

但不管怎么说,有一个中立的第三方来做这件事,本身就是进步。 总比大家各说各的、用户一头雾水要强。

六、写在最后
大模型发展到今天,"谁更强"已经不是一个靠跑分就能回答的问题了。

我们需要的,不是更多的排行榜,而是更科学的评估方法、更可信的测试数据、更中立的第三方。

NIST 正在推进的盲测计划和评估框架,就是朝着这个方向迈出的一步。这一步可能不大,但方向是对的。

对于科研工作者来说,好消息是:以后选模型,可能不用再靠"感觉"了。

💡 盈科千信全产品线--覆盖文献检索(ChatResearch)、论文写作(ChatAcademic)、文档处理(ChatDocuments)、知识管理(ChatLibrary)等全场景的科研AI工具箱。每一款产品都针对中文科研场景深度优化,支持私有化部署,数据不出境、不出院、不出企业,为高校、科研院所和企业研发团队提供安全可控的AI科研辅助能力。
回复此楼

» 猜你喜欢

已阅   回复此楼   关注TA 给TA发消息 送TA红花 TA的回帖
相关版块跳转 我要订阅楼主 盈科AI 的主题更新
普通表情 高级回复 (可上传附件)
信息提示
请填处理意见