人工智能还不能自己研究自己
作者: aeks | 发布时间: 2026-08-16 12:01 | 更新时间: 2026-08-16 12:01
学科分类: 控制科学与工程 智能科学与技术 计算机科学与技术
人工智能还不能自己研究自己
本文报道了一项关于‘AI科学家’自主科研能力的实证研究。研究团队(以普林斯顿大学计算机科学家Sayash Kapoor为首)并未依赖常规同行评审来评估AI产出质量,而是设计了更严格的‘影子评估’(shadow evaluation)方法:选取两篇已提交至NeurIPS会议的真实论文,让AI系统基于其中的研究问题独立开展研究并撰写论文,再由原作者进行专业审阅。该AI系统基于改进版OpenClaw框架,调用大语言模型Claude Opus 4.8,并配备多种工具(如创建子智能体、联网检索、调用软件库与算力资源、模拟同行评审等),每项任务限时6天、预算3000美元。结果显示,AI在工程执行层面表现良好——能稳定运行数百次实验、完成扎实的文献综述、发现少量新现象,甚至能主动识别并修正自身‘幻觉’(hallucination),避免投机取巧(reward hacking)。但其核心科研能力存在明显短板:在两项指定任务中(分别涉及聊天机器人人格精准调控方法设计、特定神经网络故障检测器设计),AI均严重失利,原作者评分仅为2/6和1/6。主要问题在于科研策略僵化——常过早聚焦单一假设,当方法失效时未能充分回溯调整;后续自我审查又过于宽松,导致不断收缩结论,最终产出内容空洞、缺乏实质洞见。研究指出,当前AI更擅长优化已有技术,而非催生真正突破;全自动开放性科研(从创意生成到论文自评)短期内尚不可行。