首頁LBank 新聞中心
研究人員讓AI從事科學研究,以失敗告終
researchers-tried-letting-ai-do-science-it-failed
研究人員讓AI從事科學研究,以失敗告終
一項跨機構研究發現,當今的前沿AI模型能夠處理研究的技術環節,但卻無法產出足以被頂級AI會議接受的原創性成果。
2026-07-30 來源:decrypt.co

簡而言之

  • 研究人員測試了前沿AI代理是否能獨立進行AI研究。
  • 這些系統完成了工程任務,但未能產出值得頂級AI會議接受的論文。
  • 該研究指出了阻礙AI產出可發表研究的五種重複性失敗模式。

一項新研究發現,當今的前沿AI代理能夠完成AI研究所需的許多工程任務,但未能產出值得頂級機器學習會議接受的原創作品。

在週三發表的研究《AI代理能否進行開放式AI研究?》中,普林斯頓大學、英國AI安全研究所、史丹佛大學、多倫多大學以及其他幾家學術和研究機構的研究人員評估了前沿AI代理是否能夠獨立進行原創AI研究。

研究人員寫道:「要嚴謹地回答這個問題,需要真實、未受污染的研究問題,這些問題是AI代理無法從其訓練數據中記憶或在網路上找到的。」「為了滿足這些要求,我們依賴於在實驗進行時尚未公開的高品質AI研究。」

研究人員向AI代理提供了兩篇未發表之NeurIPS 2026論文的核心研究問題,以防止系統從訓練數據或網路中檢索答案。每個代理獲得了六天時間、數千美元的API信用額度、GPU資源、網路存取權限以及虛擬機存取權限,以產出符合會議水準的論文。隨後,生成的論文由未發表研究的原作者審閱。兩篇論文均被拒絕。

這些代理完成了研究所需的大部分工程任務,包括進行文獻回顧、軟體除錯、執行實驗、管理GPU資源,並在沒有人工干預的情況下產出完整的學術論文。但審稿人得出結論,這些系統未能產生值得在頂級機器學習會議上發表的原創科學貢獻。

作者表示,他們的評估比以往的基準測試更能衡量科學推理能力,因為它測試的是開放式研究問題,而非預定義的任務。

作者提醒,這項研究僅檢視了兩個研究項目,並承認了其局限性,包括樣本量小以及由原始研究人員評估AI生成的論文這一事實。他們表示,結果表明當前的前沿AI代理可以自動化許多研究中的工程任務,但在產生原創科學工作方面仍然面臨困難。

這項研究發表之際,研究人員正持續揭露日益自主的AI代理中令人驚訝且有時具風險的行為。

今年五月,加州大學河濱分校、微軟和輝達的研究人員發現,AI代理在專注於完成其目標的同時,經常執行危險或不理性的任務。本月初,OpenAI披露,其一個前沿AI代理在試圖在網路安全基準測試中作弊時,逃脫了限制並駭入Hugging Face。本週,該公司透露該代理還存取了另外四項線上服務。