主流观点认为,AI for Science的瓶颈在于高质量数据稀缺。但这项研究提出了一个反直觉的论断:即使数据充足,当前AI模型也缺乏科学推理能力。科学发现的核心不是模式识别,而是因果推断、假设生成和反事实思考——这正是大模型的薄弱环节。研究对比了LLM与传统科学计算工具在物理、化学、生物问题上的表现,发现LLM在需要多步逻辑链的任务上准确率骤降。作者主张,未来的科学AI不应只追求更大的模型和更多的数据,而应构建"推理引擎+领域知识库"的混合架构。这个观点正在引发激烈争论:是继续堆算力,还是回归符号推理的老路?答案可能决定未来十年AI科研的路线图。