用物理原理模拟数据训练神经网络,让科学发现更靠谱

作者: aeks | 发布时间: 2026-08-13 10:00 | 更新时间: 2026-08-13 10:00

学科分类: 物理学 系统科学 计算机科学与技术

科学研究建模长期面临一个两难困境:基于物理或生物机制的理论模型容易理解、符合常识,但预测精度往往不高;而纯靠数据驱动的机器学习模型预测能力强,却难以解释其内部逻辑,成了‘黑箱’。现有混合方法尝试把专业知识嵌入机器学习,比如通过数学公式施加硬性约束,但当真实规律尚未完全清楚或公式写得不准确时,这类硬约束反而会误导模型,降低学习效果。本文提出‘仿真驱动型神经网络’(SGNNs)——它不强行套用公式,而是把机制模型产生的大量模拟数据(涵盖不同结构假设和真实观测噪声)作为‘教材’,预先训练神经网络。这样,网络能自主学到系统内在的动态规律,形成一种‘结构先验’。研究团队在流行病学(如新冠死亡率预测)、生态学(高维种群动态)、社会科学和化学等多个领域验证了该方法:SGNNs不仅显著超越传统纯数据模型,也优于现有物理约束混合模型;例如,在美国CDC新冠死亡预测任务中,其预测能力接近普通CDC模型的三倍;即使训练所用的模拟数据基于错误假设,SGNNs仍保持良好性能,体现出对模型误设的强鲁棒性。此外,该框架还创新性地引入‘回溯仿真归因’技术——当分析真实世界数据时,自动在海量模拟数据中找到最相似的案例,从而用已知机制来解释现实现象,实现可理解的科学推断。简言之,这项工作证明:多样、逼真的科学仿真本身,就是训练智能模型进行可靠科学发现的优质‘数据资源’。

DOI: 10.1038/s41598-026-64106-6

标签: 仿真驱动建模 模型鲁棒性 神经网络训练 科学可解释性 跨学科预测