你有没有想过一个问题:如果给AI一个足够强的大脑,让它自己去读论文、想点子、写代码、跑实验,它会变成一个靠谱的科研搭档,还是一个不停产出"看起来很对但其实站不住脚"的结论的机器?
(资料图片)
这不是一个假设。过去两年,已经有好几个团队做出了能自主搞科研的AI系统。它们能读文献、能提假设、能写代码跑实验、能生成论文草稿。乍一看,科研自动化的梦想已经照进现实。但如果你真去审查这些系统跑出来的实验记录,会发现一个让人不安的事实:很多结论看起来言之凿凿,细究起来却经不起推敲。有的实验协议前后不一致,有的测量方法本身就有问题,有的干脆是自己给自己打了"通过"的分数。
这就是这篇论文要解决的核心矛盾。清华大学EvoMap实验室的研究团队提出了一个叫AutoResearch的系统,它的目标不是让AI"看起来更像科学家",而是让AI的每一步科研决策都经得起倒查。他们给这个理念起了一个很好记的名字:Insight In, Hallucination Out,洞见进去,幻觉出来。
科研自动化,卡在哪儿了
先说清楚现在的问题出在哪。
目前大多数自主科研系统走的是这样一条路:人给一个题目或者一个初始想法,AI负责把它执行完,写代码、调参、跑实验、出报告。这个模式的问题是,AI只是一个"更快的执行者",它并没有真正参与"这个方向值不值得做"这个更前置也更重要的判断。
也有一些系统开始尝试让AI自己去发现研究方向,自己去生成假设。这个方向听起来更酷,但难度也更大:AI要怎么判断,某个来自其他领域的方法或者观察,是不是真的能迁移到当前研究的问题上?如果没有这层判断,AI很容易把两个毫不相关的概念硬拼在一起,生成一个听起来很新颖、实际上毫无意义的"伪创新"。
论文里有个说法我觉得挺精准的,他们把这种现象叫作系统层面的幻觉。就是说,实现代码上的错误、测量上的偏差、解释上的过度引申,这些东西可以一步步累积,最后变成一个逻辑自洽、但完全站不住脚的科研结论。这跟大语言模型胡编乱造事实的"幻觉"性质上很像,只不过它发生在整个科研流程里,藏得更深,也更难被发现。
于是研究团队提出了两个必须同时回答的问题:AI怎么才能从不断变化的知识环境里,持续挖出真正有价值的科研洞见?以及,当这个洞见被转化成实验结论时,怎么防止它在中途"跑偏"变成幻觉?
洞见怎么来:从信号到假设的筛选流水线
AutoResearch把整个科研过程拆成了两个阶段,第一个阶段叫Idea Generation
(研究点子生成:把外部信号和已有知识转化成一个有依据、可测试的研究假设和实验计划的过程)
这个阶段最核心的设计思路是,不让AI凭空想点子,而是让它在两类信息源之间找连接点。
第一类是外部研究信号,来自论文、代码仓库、技术社区,甚至X和小红书这样的社交平台上一些技术判断力很强的博主分享的内容。第二类是domain knowledge base
(领域知识库:系统内部维护的、总结了某个具体研究领域已有认知的知识库)
也就是这个领域里已经沉淀下来的成熟知识。
这里有个细节我觉得值得多说两句:系统并不是把所有信息源一视同仁地扫一遍。研究团队观察到,某些研究者和技术创作者长期具有很强的"策展判断力",他们经常能比传统文献检索更早地发现有价值的方法和跨领域联系。所以AutoResearch会给不同信息源打上质量先验,再叠加去重和模型筛选,把真正有技术含量的信号留下来。
光有信号和知识库还不够,中间还差一步关键的判断:这个信号能不能真正用得上?
研究团队把这一步定义为mechanism-transfer问题
(机制迁移:判断一个来自其他场景的技术方法或原理,是否可以在其内在逻辑不变的前提下,被用来解决当前领域一个尚未解决的问题)
具体做法是,给定一个候选信号和目标领域,系统会让三个独立的大模型分别判断:这个信号背后的机制,能不能真的解决目标领域里某个悬而未决的问题?而不是简单地把两边的术语拼在一起凑一个新名词。
这里有个我觉得设计得很聪明的地方:模型是被允许说"不匹配"的。也就是说,如果三个生成模型都觉得这个信号跟目标领域扯不上真正的关系,它们可以直接拒绝这次配对,而不是硬凑一个看起来花哨实则空洞的提案。
这就好比你去菜市场买菜,一个真正懂行的采购员,看到一批不新鲜的鱼,会直接说"这批不要",而不是想办法把烂鱼摆得好看点蒙混过关。如果没有这个"拒绝选项",AI就会被逼着对每一个收到的信号都编出一个理由,久而久之,生成的点子会越来越水,因为系统的激励机制变成了"必须生成"而不是"只生成有价值的"。
通过初筛的候选假设,接下来还要经历一轮交叉验证。三个前沿模型独立生成提案,另外三个模型分别当审稿人,要求至少两个正面评价才能让这个想法继续往下走。审稿人重点看三件事:这个迁移过来的机制是不是真的有技术意义,提出的方法是不是足够简单以便隔离出它的效果,以及这个假设能不能在现实的实验条件下被真正测试。
通过审稿之后,还有一道freshness检查
(新鲜度检查:核实候选想法所依赖的模型、基准数据集或参考文献是否已经过时,避免用陈旧信息支撑一个所谓的"新发现")
和domain-consistency检查
(领域一致性检查:确认这个想法确实扎实地用到了目标领域的专业知识,而不是表面上蹭了个领域名字)
走到这一步,才算是真正拿到了一个"可以拿去做实验"的研究计划。
洞见怎么落地:让每个实验结论都得先自证清白
第二个阶段叫Idea Execution,负责把已经通过验证的假设变成真正有实验依据的结论。
这个阶段的核心设计原则,用论文里的话说,是把生产一个结果和证明这个结果是有效的这两件事彻底分开。
具体怎么做的?系统把一个研究计划拆解成一张任务图,里面包含实现、试点评估、消融实验、诊断、验证这几类子任务,并且明确标注它们之间的依赖关系。执行过程中,每一步动作产生的观察结果都会被记录进一个持续更新的research state
(研究状态:一个持续记录整个研究过程演变,包括计划、代码实现、实验结果、评审意见和决策的数据结构,让整个项目可以从任何一个已验证的节点重新启动,而不是靠一份聊天记录来"回忆"之前发生了什么)
这个设计解决了一个很实际的问题:如果没有这样一个持久化的状态记录,AI跑一个长周期的科研任务,中途出了岔子,只能靠回溯一堆对话记录去猜之前到底发生了什么,很容易把之前某个已经被推翻的错误结论,当成还成立的前提继续往下推。
真正让我觉得这个设计有意思的地方,在于它怎么处理"评审"这件事。系统里有一个reviewer
(审稿人:检查实现和实验流程是否忠实于最初的假设)
和一个critic
(评审者:判断已经观察到的证据是否足够支撑正在形成的研究结论)
分别扮演不同角色,但最关键的一点是,这两个评估者都是fresh-context agent
(无历史上下文代理:一个不继承生产者推理过程的独立评估智能体,只拿到评估所必需的信息,比如假设、计划、实验产出和评估标准,而不知道产出这些结果的agent当时是怎么一步步想的)
这一点我读到的时候觉得设计得挺讲究的。你想想,如果评审者知道生产者当时的完整思考过程,很容易被带偏,觉得"哦它这么想也有道理",从而降低警惕。但如果评审者完全不知道之前发生了什么,只能拿着最终的证据和标准从零开始判断,那它反而更容易发现问题,因为它没有任何"人情包袱"要照顾。
这就像单位里搞审计,最有效的审计不是让熟悉这个项目全过程的人来复查,而是找一个完全没参与过、只看最终账本和票据的人来查账。如果审计员本身就是项目组成员,他大概率会不自觉地替之前的决定找补,觉得"这里当时肯定是有原因的"。而一个完全外部的人,只会盯着账目本身说话:这笔钱花得对不对,有没有发票支持。如果不这样设计,评审这个环节很容易变成走过场,最后系统里所有的检查其实都通不过独立性的考验。
评估结果分为PASS、PARTIAL、FAIL三档,只要不是完全通过,就会触发诊断、修订或者重新运行的流程,而不是被悄悄揭过去继续讲一个更漂亮的故事。
更关键的是,AutoResearch还专门区分了实验输出和admissible evidence
(可采纳证据:不仅包括观察到的结果本身,还必须包含对应的持久化记录,比如评估日志、检查点文件或结果文件,才能被认定为支撑某个研究结论的有效证据)
一个研究结论要被接受,必须有独立验证通过的证据支撑,而不是执行任务的agent自己觉得"这个结果挺好,应该算成功"就可以了。这个设计直接决定了后面能不能对研究方向做出continue、revise、scale、stop这几种决策,甚至一个被证据支持的负面结果,也被认定为一个有效的科研产出,而不是任务失败。
三个场景,看AutoResearch到底靠不靠谱
光讲设计理念还不够有说服力,研究团队选了三个很有代表性的场景来验证这套系统,同时拿The AI Scientist、Agent Laboratory、R&D-Agent、AutoResearchClaw这四个已有的自主科研系统来做对比。
第一个场景是跨模态检索,用的是遥感图像描述数据集RSICD
(RSICD:一个用于测试图像和文字互相检索能力的遥感图像描述基准数据集,评价指标是mean Recall,也就是平均召回率)
AutoResearch的Idea Forge模块提出了一个分阶段的假设,包含更强的全局图文对齐、文本引导的局部特征聚合、以及显式的实体位置关联这三个组件。研究团队没有把这三个组件打包成一个整体去测试,而是一步一步单独引入,在同一套评估协议下逐个验证效果。
结果是这样的:基线的mR是32.84,加上全局对齐提升到33.89,再加文本引导的局部池化提升到34.04,最后加上实体位置关联达到34.69,总提升1.85个百分点。这个逐步递增的曲线本身就是一份证据,说明生成的这个研究点子确实可以拆解成一个个可独立验证的机制,而不是一锅端出来一个数字就完事。
更值得关注的是审计结果。同一套流程下,AutoResearch只记录了5次audit-confirmed issue events
(审计确认问题事件:经过独立审计核实、确实存在问题的实验流程或结论环节数量)
对比之下,R&D-Agent是11次,AutoResearchClaw是15次,Agent Laboratory是18次,The AI Scientist是27次。这个差距挺大的,说明同样是拿到一个不错的最终数字,AutoResearch这条路走得干净很多,而其他系统的漂亮数字背后,可能藏着更多没被自己发现的问题。
第二个场景专门设计来测试一件事:AutoResearch会不会被一个"看起来成功"的结果骗过去。任务是一个1024×1024的FP32矩阵乘法,要求在200毫秒内完成,相对误差不超过十万分之一,并且十次运行的变异系数要低于20%。
AutoResearch跑出来的第一版结果,速度和精度都达标了,但试点阶段没通过稳定性检验。这时候系统没有直接把这个漂亮的速度数字当成结论接受下来,而是触发了更深入的诊断。最后定位到问题出在计时方式上:多线程BLAS库跑的时候,系统把CPU时间和真实的墙钟时间搞混了。修正测量方法之后重新跑,最终确立了一个可复现的基线,3.4毫秒,对应626 GFLOPS的算力,大约是目标速度要求的58倍。
这个案例真正有价值的地方不是最后跑出多快,而是系统拒绝了一个看起来很诱人的中间结果,坚持要求这个数字的产生过程本身能站得住脚才认账。这就好比你去体检,报告上写着某项指标"正常",但如果医生发现这个数字是护士记错了单位测出来的,一个负责任的医生不会因为数字看起来正常就直接签字,而是会要求重新抽血再测一次。如果不坚持这一步,你拿到的那份"正常"报告,本质上是一个巧合,而不是真实情况。
这次审计确认的问题事件数,AutoResearch是4次,R&D-Agent和Agent Laboratory都是5次,AutoResearchClaw是7次,The AI Scientist是8次,依然是最少的。
第三个场景换了个角度,考察的不是"能不能把点子做对",而是"知不知道什么时候该继续、该修改、该停下"。研究团队选了三个Kaggle上很经典的机器学习任务:泰坦尼克号生存预测、房价预测、灾难推文分类。
三个任务的走向完全不一样。泰坦尼克号任务,特征扩展把五折交叉验证准确率从0.822提升到0.843,超过了预设的0.830目标,系统判断这个方向值得进一步扩大规模去做。房价预测任务,RMSLE
(均方根对数误差:房价这类回归任务里常用的误差衡量指标,数值越低表示预测越准)
从0.2008一路降到0.1251,虽然还没达到0.120的目标,但差距已经不大,系统判断值得继续修订而不是就此接受当前方案。灾难推文分类任务,F1值从0.763提升到0.805,但离0.835的目标还有明显距离,而且最后几轮改进带来的收益已经很有限,系统判断这个方向已经进入平台期,于是终止了这个方向,同时把这个负面结果如实保留下来,而不是硬凑一个"勉强达标"的说法。
这三条不同的路径合在一起说明了一件事:AutoResearch的研究是否继续,取决于积累下来的证据,而不是取决于已经跑了多久。一个达到目标的方向可以被放大,一个还有希望的方向可以被继续修订,一个已经不再产生实质进展的方向,可以被叫停,而不需要无休止地找一个正面结果。
这套系统跑起来到底能有多大规模
论文里还提到了一个具体的运行数据,我觉得挺能说明问题的规模感。研究团队用一台配备双路英特尔至强8563C处理器、8块英伟达L20 GPU、944GB内存的服务器,让AutoResearch连续运行一周,大约生成了2584个候选研究点子。经过多模型评审和筛选后,大约355个想法进入实验队列,最终大概22个想法被真正跑了实验,其中约14个得到了实证支持。
这组数字背后其实透露出一个很实际的取舍:从2584个候选到最后14个被验证的想法,中间层层筛选掉的比例相当高。这说明系统的重心确实放在了严格筛选,而不是尽可能多地产出所谓的"科研成果"。如果没有这种层层收窄的漏斗结构,一周跑出2584个想法这件事本身没有任何意义,因为质量根本无法保证。
还没解决的问题和接下来要走的路
研究团队也很坦诚地指出,这套系统目前依然依赖外部信号的覆盖广度、领域知识库本身的质量,以及是否存在明确的实验验证标准。换句话说,如果给的知识库本身就不够扎实,或者某个任务压根没有清晰的验证标准,这套系统的判断力也会跟着打折扣。
他们提出的下一步方向,是把每一轮研究周期里验证过的证据和结论,反过来喂回知识库里,让下一轮研究能同时受益于外部世界不断更新的信息,也能受益于系统自己积累下来的验证经验。这有点像一个人不仅要读书看新闻,还要真正把自己做过的事情、犯过的错误记下来,下次遇到类似情况才不会重蹈覆辙。
Q&A
Q1:AutoResearch是什么?
A:AutoResearch是清华大学EvoMap实验室开发的一个自主科研系统,分为Idea Generation和Idea Execution两个阶段,前者负责把研究信号和领域知识转化成有依据的研究假设,后者负责把假设通过实验和独立审核转化成有证据支撑的研究结论。
Q2:AutoResearch和其他自主科研系统比,优势在哪?
A:核心优势在于审计确认的问题事件数量更少。在RSICD跨模态检索实验中,AutoResearch只有5次问题事件,而The AI Scientist有27次,Agent Laboratory有18次,说明它跑出的结果更靠谱,不容易掺杂未被发现的错误。
Q3:AutoResearch遇到不理想的实验结果会怎么处理?
A:系统会根据证据决定继续、修订、扩大规模或终止这个研究方向。比如在灾难推文分类任务中,因为提升已经进入平台期且离目标差距较大,系统选择终止该方向并如实保留这个负面结果,而不是硬凑一个达标的说法。
[责任编辑:linlin]
标签: 实验 信号 知识库 autoresearch
伊拉奥拉将卡马拉列为优先目标,利物浦中场引援转向
AutoResearch:当AI科学家学会"先想清楚为什么,再动手做实验" 每日热文
快报:同是事业编,专业技术岗和管理岗工资相差2000元!为何差别这么大?
要闻速递:太猛了!中国1小时连夺3金,打破世界纪录+16岁杜雨宸一战成名
【独家焦点】现代五项女子团体夺冠 中国代表团收获第20届亚运会首金
吉利银河TT上市,限时先享价12.99万元起 每日信息
新一期贷款市场报价利率未作调整_每日视点
哈里梅根小孩转学上热搜!威廉家孩子洗礼都是高逼格,新一轮宫斗要开始了
每日简讯:苏超南通队主场迎战无锡队,《歌唱祖国》点燃全场氛围
焦点热讯:1:1绝平!八强,无锡来了!无锡高新区“第二现场”持续高燃
西贝回应倒闭传闻:目前全国门店均正常运营
报道:皇马“废太子”,真就带不动强强对话?