这项由东南大学、华东师范大学与香港科技大学联合开展的研究,以预印本形式发表于2026年7月,论文编号为arXiv:2607.11079,有兴趣深入了解的读者可通过该编号查询完整原文。
科学研究的核心,说白了就是"从数据里找答案"。一个医生看完化验单,要能判断病人是否有炎症;一个气象学家分析温度数据,要能预测明天会不会下雨;一个生物学家测量了一百只小鼠的体重,要能判断某种药物是否真的有效果。这些看似不同的工作,背后都在做同一件事:对数据进行科学分析,然后做出可靠的判断。
近年来,以ChatGPT为代表的大型语言模型(也就是俗称的"大模型"或"AI")正在越来越多地参与到科学研究过程中,从预测蛋白质结构到自动生成研究假设,AI的身影无处不在。那么问题来了——这些AI在科学数据分析这件事上,到底做得怎么样?它们真的能像一个合格的科研助手那样,读懂数据、做出靠谱的判断吗?
研究团队发现,目前学界对AI的"科学数据分析能力"的评测,几乎都停留在考察"能不能跑出代码"这个层面——也就是说,只要AI写的程序能运行、能输出结果,就算过关了。但这就好像考驾照只考"能不能发动汽车",却不考"能不能安全驾驶到目的地"一样,根本没有测到最关键的能力。于是,这支团队决定造一张真正的"科研能力体检表",系统检验AI在六种不同类型的科学推理任务上究竟表现如何。这张体检表,就是他们推出的SDABench基准测试。
一、为什么现有的"考试卷"考不出真本事
现有的AI科学数据分析测试,大多是这样设计的:给AI一个数据集,让它写代码、跑分析、输出结果,然后对比结果对不对。这类测试的问题在于,它混淆了"做对了计算"和"做了正确的科学判断"这两件事。
打个比方:你让一个学生计算一组数据的平均值,他算对了,得了满分。但如果他根本不知道为什么要算平均值、在什么情况下平均值不适用、算完平均值之后该怎么解读,那他其实并没有真正掌握数据分析的能力。现有的测试,就是这种"只考算术、不考理解"的水平。
更麻烦的是,现有测试往往用一个总分来概括AI的表现,这就像用一个数字来评价一个人的健康状况一样——100分意味着什么?是心肺功能很好但骨密度很差,还是整体均衡?根本看不出来。不同类型的科学分析任务,对AI提出的要求是截然不同的,一个总分掩盖了所有的差异。
研究团队认为,科学数据分析的目的不是"跑程序",而是支撑科学主张。而科学主张有好几种不同的形态:描述现象(这堆数据长什么样)、探索规律(数据里有没有什么有趣的模式)、推断结论(基于这个样本,能对更大范围做什么判断)、做出预测(根据已有数据,未来会发生什么)、分析因果(改变某个变量,会不会导致另一个变量改变)、解释机制(为什么会出现这种现象,背后的原理是什么)。这六种任务,对应着科学研究中六种截然不同的思维方式,当然应该分开来考察。
二、SDABench:一张真正的"科研能力体检表"是怎么造出来的
研究团队基于麻省理工学院科学家Leek和Peng在《科学》杂志上提出的六类数据分析问题框架,将其重新诠释为六种科学发现能力,分别是:描述性分析(说清楚数据是什么样的)、探索性分析(在数据里寻找可能有意义的模式)、推断性分析(用样本数据对更大范围的现象做出有量化不确定性的判断)、预测性分析(用已知变量估计未知结果)、因果性分析(评估某种干预或变化对结果的影响)、机制性分析(用数据和领域知识解释某个现象背后的运作过程)。
在学科领域上,SDABench覆盖了生物学、化学、环境科学、地理学和物理学五个核心理工科方向。这样的设计保证了测试不局限于某一个学科的特殊性,而是检验AI在广泛科学场景下的通用推理能力。
整个基准测试由两部分组成。第一部分叫SDA-Real,收录了527道基于真实世界科学数据集的题目,数据来源涵盖了多个已有的科学数据分析基准测试(如KramaBench、BLADE、DiscoveryBench、LLM-SRBench、QRData、SciTS、ScienceAgentBench),经过重新筛选和精心设计,只保留那些数据结构清晰、分析目标明确、答案可以通过程序验证的高质量实例。第二部分叫SDA-Synth,包含6000道基于合成数据集的题目。
为什么要有合成数据?因为真实科学数据集通常是为某一个特定研究设计的,往往只能支撑某几种分析类型。如果每种分析任务都用不同的数据集,那分析起来就很难判断AI表现的差异到底是题目难度不同造成的,还是AI能力本身的差异。合成数据集则可以在同一组数据上同时支撑全部六种分析任务,保证对比的公平性。
合成数据的生成过程相当严谨。研究团队先让GPT-4o提出候选科学场景(比如植物胁迫生理学、聚合动力学等),每个场景都明确指定了哪些变量是可测量的、单位是什么、范围是多少。然后为每个场景构建一个"语义有向无环图"——这个图的每个节点代表一个变量,边代表变量之间的因果或函数关系。每个非源头变量都有一个明确的数学机制(代数方程或微分方程),规定了它如何由其父变量决定。对于有因果关系的变量,还专门用一套叫做"内部标准化结构因果模型"的框架来精确刻画干预效应是如何通过中间变量传递到目标变量的。整个数据集按照图的拓扑顺序生成,源头变量随机采样,其他变量通过执行对应的数学机制计算得出,并加入了受控的测量噪声。最终得到50个经过专家审核的合成数据集,每个领域10个,每个数据集支持全部6种分析类型。
题目的生成过程也有一套三阶段流水线。第一阶段,由一个由四个AI子智能体组成的流水线来构建题目模板:分类器把种子问题分配到对应领域和任务类型,提取器把具体的数据集相关实体替换成占位符生成通用模板,生成器把模板填入特定数据集的具体变量,验证器负责排除逻辑矛盾、占位符未解析、答案泄漏等问题。第二阶段,对每个模板实现一个确定性的答案推导程序,给定数据集和具体参数就能自动计算出标准答案,保证答案的客观可验证性。第三阶段,为多选题生成干扰选项,干扰选项通过四种扰动策略生成:交换变量角色(扩散扰动)、修改某个局部参数(混淆扰动)、随机采样一个不同答案(随机化扰动)、简单数值变换(默认扰动)。这样的设计让干扰项看起来合理但实际错误,真正考验AI是否走了正确的分析路径而不是靠排除法碰运气。
每道题同时提供两种格式:多选题(四个选项里选一个)和开放题(直接给出答案)。多选题便于自动批量评测,开放题则更贴近真实科研场景,能反映AI的真实推理能力。多选题答对的概率下限是25%(随机猜),开放题没有这个"地板",所以研究团队以开放题的得分作为主要评测指标,多选题作为辅助参考。
三、15个主流AI模型大考:谁厉害、谁在哪里拉胯
研究团队评测了15个代表性的大型语言模型,涵盖了闭源商业模型和开源模型两类。闭源模型包括GPT-5.4、GPT-5.4 mini、Claude Sonnet 4.6、Gemini 3.1 Pro和Gemini 3.1 Flash;开源模型包括DeepSeek V3.2、DeepSeek R1、Qwen 3.5-397B-A17B、Qwen 3-235B-Instruct、Kimi K2.5、GLM 5、Llama 3.3-70B-Instruct和Llama 3.1-8B-Instruct。此外还对Llama 3.1-8B-Instruct进行了微调,形成两个变体。所有模型都在零样本设置下测试,即直接给题目,不提供任何示例。
从整体得分来看,最强的闭源模型GPT-5.4的开放题准确率为58.33%,Gemini 3.1 Pro以56.88%紧随其后,Claude Sonnet 4.6为55.79%。经过任务针对性微调的小模型Llama 3.1-8B-Instruct,开放题准确率达到了55.33%,已经接近顶级大模型的水平,说明针对性训练对小模型的帮助相当显著。相比之下,Llama 3.1-8B-Instruct的原始版本开放题准确率只有5.04%,差距极为悬殊。
按任务类型细分,所有模型在描述性任务上表现最好,顶尖模型的准确率可以达到90%以上。毕竟,"描述数据样本的基本特征"这件事,主要就是汇总和总结,难度相对最低。然而,当任务换成推断性分析(需要从样本数据对更大范围做出判断)和因果性分析(需要评估干预效果)时,准确率明显下降。探索性任务和预测性任务则出现了不同方向的困难:探索性任务要求在约束条件很弱的情况下搜索可能的规律,类似于在杂乱的房间里寻找一件不知道放在哪里的东西;预测性任务要求选择合适的模式并将其应用到没见过的情况,类似于学会了一道菜的做法后,用新食材做出同款口感。机制性任务则出现了有趣的"格式差异":给定多选项时,强模型能够识别出合理的机制;但在开放题格式下,AI必须自己把变量、关系、中间步骤串联成一个完整的因果链,这对现有AI来说相当困难。
按科学领域分析,环境科学的整体准确率最高,达到46.9%;生物学最低,只有39.2%。这个差距并不是因为AI"懂"环境科学多于生物学,而是因为环境科学数据中的变量往往是连续平滑的,趋势比较直接;生物学数据则常常包含高维度的非线性交互作用,样本外预测难度更大。地理学的问题出现在探索性分析(30.9%)和机制性分析(24.9%)上,因为地理数据需要从符号性数据中推断出空间结构,这对AI来说是一个特殊的挑战。
四、不只是"对不对":五层错误解剖刀找出AI卡在哪里
研究团队没有满足于只报告准确率,他们还开发了一套五阶段错误分析框架,把AI的错误按照科学数据分析的执行流程逐层分类。这五类错误分别是:范围错误(误解了分析目标或任务边界)、变量错误(选错了分析变量)、方法错误(选了错误的分析方法或公式)、关系错误(对变量之间的关系——是否存在、方向、强度、结构——判断有误)、结论错误(最终推断与前面的分析结果不一致或不被数据支持)。研究团队对所有错误案例都标注了"第一个出错的环节",然后计算每种错误类型的归一化发生率。
按任务类型看,方法错误在预测性任务中最为突出,归一化错误率高达37.7%,在推断性任务(23.0%)和描述性任务(13.4%)中也相当常见,反映出AI在选择合适的统计方法或正确实现公式方面存在系统性问题。关系错误则在机制性任务(32.1%)和探索性任务(29.9%)中最为集中——在这两类任务里,"变量之间的关系结构"本身就是分析的目标,AI常常把噪声当成信号,或者没有足够的机制知识来重建因果传递链。结论错误在推断性任务中最多见(10.2%),反映出AI在处理不确定性时容易做出过于武断的判断。
按科学领域看,生物学的错误主要集中在方法层面(29.8%),AI能识别出相关实体,但会用通用统计方法替代领域专用的分析方法。化学(24.6%)和环境科学(27.0%)的主要问题是关系错误,因为这两个领域的变量交互依赖于耦合过程、阈值效应或混杂因子,AI难以准确把握。地理学的范围错误率最高(9.9%),说明AI经常误解地理分析的分析目标。物理学的变量错误率最高(14.5%),AI能找到正确的公式,却搞错了哪个变量对应哪个物理量,或者忽视了单位和物理角色的约束。
按模型水平看,规律相当清晰:较小的基础模型(如Llama 3.1-8B和Llama 3.3-70B)的变量错误率极高,常常超过30%,说明它们连"用哪些变量来回答这个问题"都搞不清楚。更强的模型把这类基础性的定位错误大幅降低了,但错误的重心随之转移到了执行层面:DeepSeek R1、DeepSeek V3.2、Qwen 3.5和GPT-5.4主要被方法错误拖累,说明它们理解了要做什么,但选错了怎么做;而Kimi K2.5、Claude Sonnet 4.6和Gemini 3.1 Pro方法错误率较低,但关系错误率较高,说明它们能够执行正确的操作,但对变量之间关系的刻画仍然不够准确。
这个发现的含义相当深刻:随着模型变强,错误并没有消失,只是从早期阶段(搞不清楚分析对象是什么)转移到了晚期阶段(能找到正确对象,但分析过程和推断结论仍然出错)。这意味着,简单地把模型做大、做强,并不能自动解决科学推理中最本质的难题。
五、多选题"陷阱"与合成数据的可靠性
研究团队注意到一个有趣的现象:对于某些任务类型,给AI提供多选项反而会降低它的表现。以Kimi K2.5为例,在预测性任务的开放题上它表现正常,但在同样内容的多选题上,准确率几乎跌到随机猜测的水平(25.75%)。这说明,看到选项之后,AI反而被选项的外观特征所干扰,开始做表面模式匹配,而不是老老实实走一遍分析流程。
相反,Llama 3.3-70B-Instruct在多选题的因果任务(24.00%)和探索性任务(23.50%)上也接近随机水平,但原因完全不同——它根本就不会做这类分析,有没有选项都救不了它。这两种情况都说明,多选题格式有其误导性:它既可能让本来会做的AI因为"看选项"反而答错,也可能让本来不会做的AI因为"能猜"而虚报高分。这对大量依赖多选题评测AI能力的研究来说,是一个值得警惕的信号。
在真实数据集(SDA-Real)上的测试结果,与合成数据集上的规律总体吻合:描述性和推断性任务相对较易,探索性和预测性任务相对较难。但真实数据也暴露了合成数据无法完全模拟的特点:真实数据集中的变量名往往是标准术语(如"温度""湿度"),AI的预训练知识与这些术语高度匹配,有时会让机制性任务的表现虚高;而真实数据的模式更复杂、噪声更多,探索性任务对此更敏感。研究团队认为,正因为两类数据各有侧重、互为补充,所以SDABench同时保留了两者。
六、这些发现对未来AI科学助手意味着什么
研究团队特别强调了一点:更强的模型并不是因为"知识不够"才出错,而是因为"知识用错了地方"。它们能认出公式,能识别变量,但在需要选择合适的假设检验方式、准确刻画多变量之间的耦合关系、或者把中间推理步骤串联成一个自洽结论时,仍然频频出错。这三个方向——在不确定性下选择假设、对变量交互关系进行关系推理、以及对中间推理结果进行逐步验证——正是未来改进AI科学数据分析能力的关键突破口。
SDABench提供的这套"五阶段流水线式错误分类"不仅是一个诊断工具,还可以直接用于指导AI的训练课程设计:按照分析流水线的阶段顺序,针对每个阶段的能力短板分阶段施训,而不是笼统地让AI"多刷题"。
说到底,这项研究要传达的核心信息很简单:AI在科学数据分析这件事上,还没有真正"毕业"。它们能做好最基础的"描述题",但在需要选对方法、理清关系、做出严谨推断这些更深层的科学思维任务上,表现还差得远。更重要的是,用一个笼统的"通过/不通过"来评价AI的科研能力,就像用"及格/不及格"来评价一个医学生是否能独立行医一样,远远不够精确。SDABench提供了一种更像"体检"而非"过关"的评测视角,让我们能看清楚每一个具体的短板在哪里。
对于普通人来说,这项研究意味着:当我们听到"AI已经能做科学研究了"这样的说法时,要多问一句——它能做哪种科学研究?描述数据样本的特征,它也许真的能做得不错;但如果你需要它帮你判断某种药物是否真正有因果效果、或者解释某个物理现象背后的运作机制,它给出的答案可能看起来很自信,实际却并不可靠。学会区分AI能力的层次,比盲目信任或盲目拒绝都更明智。
有兴趣进一步了解的读者,可以通过arXiv编号2607.11079查阅完整论文,原文包含了所有模型的详细评测数据、误差分析图表以及完整的基准构建方法说明。
Q&A
Q1:SDABench和现有AI科学数据分析测试有什么本质区别?
A:现有测试主要考察AI能不能"跑出代码、输出结果",相当于只考学生会不会按计算器。SDABench则把科学数据分析拆解成六种能力——描述、探索、推断、预测、因果、机制——分别测试,还有一套五阶段错误分析框架,能精确定位AI在分析流程的哪个环节出了问题,而不是只给一个总分。
Q2:为什么多选题格式有时候反而会让AI表现更差?
A:多选题提供了现成的答案选项,有些AI看到选项后会做"表面模式匹配"——就是凭选项的样子来猜,而不是老老实实地走一遍分析流程。SDABench的测试发现,Kimi K2.5在预测性任务的开放题上表现正常,但在同内容多选题上准确率近乎随机猜测,说明显式选项确实会干扰某些AI的正常推理过程。
Q3:目前最强的AI在科学数据分析上的准确率大概是多少?
A:以开放题为主要指标,当前最强的闭源模型GPT-5.4准确率为58.33%,Gemini 3.1 Pro为56.88%,Claude Sonnet 4.6为55.79%。经过针对性微调的小模型Llama 3.1-8B-Instruct也能达到55.33%。总体而言,开放式科学数据分析任务远未被解决,尤其是预测、探索和机制性分析,仍然是所有模型的明显短板。