先搞懂:什麼是 AI 代理?

一般的聊天 AI 是「你問、它答」,AI 代理(agent)則會自己動手做事:它可以安裝軟體、呼叫工具、執行程式,再把結果整理回報給你。Paper2Agent 做的事情,就是把一篇論文變成這樣一個代理。

從被動文件到會動手的代理

多數論文是拿來讀的,不是拿來用的。研究者想套用論文裡的方法,通常得先安裝作者的軟體、搞懂資料要怎麼餵進去,光是這一步就可能卡上好幾天。

Earth.com 10 月 4 日報導,史丹佛大學博士後研究員 Jiacheng Miao 與副教授 James Zou 等人開發的 Paper2Agent,把這一步省掉了:使用者用白話提問,代理直接執行論文本身的程式碼來回答。這項研究已刊登在《Nature》期刊。

整套做法分成三段,各由一個代理負責:

  • 架環境:第一個代理負責安裝程式碼需要的軟體環境。

  • 做工具:第二個代理把論文的主要方法包裝成其他 AI 也能呼叫的工具。

  • 驗結果:第三個代理拿論文裡報告的結果和圖表逐一測試,反覆失敗的工具直接淘汰。

Paper2Agent 三個代理流程:架環境、包裝工具、對照論文結果測試,最後打包成 MCP
Paper2Agent 的三段流程:架環境、把方法包成工具、對照論文結果測試,通過的工具再打包成 MCP。(圖:AI 生成,ChatGPT)

通過測試的工具,會連同論文文字、資料和常用分析步驟,用 Model Context Protocol(MCP)打包。MCP 是一套讓 AI 存取外部工具和資料的共通規格,可以想成 AI 世界的通用插座。Zou 形容,MCP 讓論文變成代理容易存取的形式,「幾乎像一套歸檔系統」。

數字怎麼說

以 Google DeepMind 的基因體模型 AlphaGenome 為例,系統在大約 45 分鐘內、完全不用人介入就建出 22 個工具,在個人筆電上就能執行,花費只有 14 美元。

在 30 個需要串接多個工具的開放式研究問題上,代理得分 82.7%;直接讀程式碼的 Claude 只有 56.7%,另一個研究助理 Biomni 是 72.2%。

擴大測試時,100 篇計算生物學論文中有 74 篇成功轉成代理,提出的 599 個工具有 593 個通過測試;在 300 個問題上得分 91.2%,高於直接讀程式碼的 80.3%。失敗的主因是缺程式碼、缺資料,或軟體裝不起來。

Paper2Agent 測試數據:82.7% 成功率、100 篇轉成 74 篇、599 個工具通過 593 個、45 分鐘建 22 個工具、花費 14 美元
關鍵數字:開放式問題得分 82.7%,100 篇論文有 74 篇轉成代理,AlphaGenome 約 45 分鐘建出 22 個工具、花費 14 美元。(圖:AI 生成,ChatGPT)

三個代理一起找乾癬基因

最受矚目的實驗,是讓三個論文代理分工合作。AlphaGenome 代理先預測:在 CD4+ T 細胞(一種調控免疫反應的白血球)中,和乾癬有關的基因位點,對 GPR137 這個基因影響最大。

研究者再接上另外兩篇既有論文的代理比對資料,結果五個候選基因中只有 GPR137 吻合,而且只出現在受刺激的細胞裡。整個過程沒有做任何新的實驗,用的都是既有資料。

限制也很清楚

作者強調,代理不是獨立的科學家:研究方向仍由研究者決定,證據也仍要由人來評估。發布代理的人得持續維護底層軟體;安全、所有權和學術功勞怎麼歸屬,也都還沒有答案。作者也建議,期刊未來或許可以要求論文附上「代理可用性」聲明。

對臺灣的意義

對研究機構來說,Paper2Agent 最值得看的不是準確率,而是那 26 篇失敗的論文:缺程式碼、缺資料、環境裝不起來。

臺灣的研究法人和大學每年產出大量計畫報告與實驗資料,但程式和資料常散落在個人電腦裡,計畫結案後就沒人維護。如果知識管理只停留在「PDF 歸檔」,未來就接不上代理化的工作方式。

左邊是堆滿 PDF 與紙箱的舊檔案室,右邊是程式碼、資料與環境整齊歸位、AI 代理可直接運作的研究室
知識要能執行,而不只是歸檔:程式碼、資料和執行環境一起交付,研究成果才接得上代理。(圖:AI 生成,ChatGPT)

比較務實的第一步有兩件事:

  • 把程式碼、資料和執行環境當成研究成果的一部分交付,而不只是交一份報告。

  • 先訂好內部資料的存取權限、維護責任和功勞歸屬規則,再來談讓報告「開口說話」。

來源