与上海人工智能实验室等联合发布AI4S多模态评测集

与上海人工智能实验室等联合发布AI4S多模态评测集

大模型已经能够回答复杂的科学问题,也能识别和描述图像内容。但在真实科研场景中,看见图像并不等于理解实验。面对一张真实实验图像或分析结果,模型能否抓住其中的关键信息,判断当前实验状态,并给出合理的解释和下一步建议?

为回答这一问题,晶泰科技联合上海人工智能实验室、中国科学院上海硅酸盐研究所、上海交通大学、嘉兴大学等机构,联合创建了 LabOPBench——一个面向真实化学与材料实验场景的多模态评测集。它包含 756 道由实验人员设计并独立审核的题目,重点考察模型能否将真实实验中的视觉证据转化为可靠的实验判断。

我们对 7 个主流多模态模型进行了系统测试。结果显示,没有一个模型的总体得分超过 50%,最高分仅为 45.8%。这意味着,当前模型虽然已经具备一定的科学知识和图像理解能力,但距离稳定、可靠地理解真实实验,仍有明显差距。

在真实科研中,许多关键问题并不存在可以直接检索或套用的标准答案。研究人员需要结合实验现象、仪器输出和样品状态,识别与决策相关的证据,并进一步判断:当前实验是否处于正常状态,异常可能由什么原因引起,以及接下来应该采取什么操作。

LabOPBench 共覆盖五类实验任务;
图 a 展示五个大类及其题目占比,
图 b–e 呈现实验准备、实验后处理、
实验监测和实验表征四个大类下的细分类别分布

LabOPBench 正是围绕这类 “从实验观察到科学决策” 的问题构建。评测共包含 756 道题目,其中 664 道来自有机合成实验92 道来自材料科学实验。题目均基于真实实验图像和科学分析结果,覆盖两个领域中的典型实验判断场景。这些题目关注的并不是模型 “记住了多少科学知识”,而是它能否真正读懂实验现象:从图像和分析结果中提取关键证据,并根据具体问题判断实验状态、分析可能原因,或给出合理的后续操作。

LabOPBench 并不只考察模型对实验器材或表面现象的识别能力。每道题均对应一个具体且可独立判断的实验情境,模型需要结合图像证据与必要的背景信息,对当前实验状态进行判断,分析潜在原因或风险,并提出合理的后续操作建议。

LabOPBench 的核心评测目标,在于考察模型能否完成从实验现象观察、状态与原因分析,到后续操作决策的完整推理过程。模型不仅需要判断实验中发生了什么,还需要说明其可能原因,并据此给出相互一致的处理方案。

所有题目均采用开放式文本作答,而非预设选项。每道题均配有由专家制定的 0—3 分评分标准。评分不仅考察最终结论是否正确,还关注回答是否识别了关键实验依据,以及状态判断、原因分析与操作建议之间是否保持一致。

我们在完整的 756 道题目上评测了 7 个主流多模态模型。Claude Opus 4.7 以45.8% 的总体得分位列第一,GPT-5.5 以 43.6% 排名第二,Gemini 3.1 Pro 以 41.9% 排名第三。所有模型的总体得分分布在 36.7% 至 45.8% 之间,没有一个模型超过 50%

进一步来看,模型在不同实验场景中的表现差异明显。其中,反应后处理的整体表现最低,七个模型的平均得分为 36.3%,且该类别在全部七个模型中均取得最低得分。

在有机化学实验中,反应后处理是连接反应过程与最终样品获得的核心环节,涵盖分离、纯化和过程状态判断等一系列关键操作。实验能否最终获得合格样品,往往取决于这一阶段能否根据实际现象及时作出正确判断。模型在这一核心环节上的表现相对较弱,表明其在真实实验中的操作判断能力仍有较大提升空间。

为了更直观地了解模型目前处于什么水平,我们让 7 个模型、5 名本科生和 5 名博士生完成同一组 100 道有机化学实验题。所有人类参与者均基于与模型相同的图像和背景信息独立作答,回答也采用相同的标准进行评分。

结果显示,本科生和博士生的平均得分分别为 31.0% 和 45.9%。表现较好的 Claude Opus 4.7 和 GPT-5.5 分别获得 43.7% 和 43.5%,超过本科生平均水平,但仍低于博士生平均分。

这一结果表明,顶尖多模态模型已经超过本科生参与者的平均水平,展现出一定的实验判断能力。但即使是表现最好的模型,也未达到博士生参与者的平均分。当前模型在真实实验情境中的表现仍有进一步提升空间。

模型在评测中的得分,究竟来自对实验图像的真实理解,还是主要依赖问题文字和已有知识进行推断?为了验证这一点,在同一组 100 道题目上,我们进一步进行了图像错配实验,以检验模型的回答究竟依赖真实图像,还是主要来自问题文字和已有知识。实验将原始图片替换为同一细分类别中、但与当前问题不匹配的图片,其余设置保持不变。

结果显示,7 个模型的得分均明显下降,跨模型平均分由 39.0% 降至 20.1%,平均下降 18.9 个百分点。其中,GPT-5.5、Gemini 3.1 Pro 和 Claude Opus 4.7 的降幅均超过 20 个百分点。

这说明,实验图像并不是可有可无的附加信息,模型的回答确实依赖图像与问题之间的对应关系。但与此同时,对图像敏感并不意味着模型已经正确理解了图像中的实验信息。模型可能利用了部分视觉线索,却仍未识别真正决定答案的关键证据。

为进一步识别高性能模型的主要失分来源,我们对总体表现最好的 Claude Opus 4.7、GPT-5.5 和 Gemini 3.1 Pro 进行了专家错误分析。两名专家逐一审查三个模型的非满分回答,并将能够明确归因的问题归纳为六类错误。

结果显示,证据提取失败(40.0%)和原因—行动不匹配(35.8%)合计占 75.8%,其余四类错误占比均低于 8%。这表明,高性能模型的主要瓶颈不在于孤立的化学知识错误,而在于证据驱动推理链条仍不稳定:模型难以准确识别决策相关的关键实验信息,并将原因判断转化为一致、可执行的操作建议。

LabOPBench 的结果表明,当前多模态模型已经能够利用真实实验图像和分析结果,并在部分任务中作出合理判断。但从总体表现、人类对比、图像错配和错误分析来看,模型仍难以稳定识别与当前实验决策最相关的证据,并据此形成一致的原因解释和行动建议。

模型能力的进一步提升不能只依赖扩大规模或补充科学知识,更需要强化基于真实证据进行状态判断、原因分析和行动选择的能力。相应的训练数据也应覆盖失败案例、干预结果和验证过程,而不仅是成功的实验流程。

从看见实验,到理解证据,再到作出可靠判断,仍是大模型走向可信实验助手需要跨越的重要一步。

• 项目资源

LabOPBench 的项目介绍、部分数据与评测资源已公开,后续内容将持续更新。

人工智能 + 机器人
技术平台
驱动行业创新

推荐文章

从“看得见的AI”到深度应用,晶泰科技AI for Science进展、生态成果集体亮相WAIC
晶泰孵化无界进化虚拟细胞模型达行业最优(SOTA),科学发现引擎开启内测申请
AI for Science 落地路径:晶泰以 Physical AI 赛事,预演研发产业未来
智能伙伴第五年,晶泰科技2026WAIC五大亮点抢先看!