返回行业动态
研究前沿

斯坦福 Paper2Agent 登上《自然》:把论文与代码库变成可验证的 MCP 智能体

9月16日《自然》发表斯坦福团队论文,提出 Paper2Agent 框架,把论文正文、补充材料、数据集与代码库自动转换为一个 MCP 服务器,任何兼容 MCP 的智能体都能用自然语言调用论文方法。为 AlphaGenome 构建22个工具耗时约45分钟、花费14美元,全部自动通过验证;教程类问题得分98.7%,新问题100%。100篇 bioRxiv 计算生物学论文中74篇完成智能体化,599个候选工具593个通过验证。这为科研方法的可复现性提供了工程化路径。

来源:Nature(论文)原标题:Reimagining research papers as interactive and reliable AI agents查看原文
深色生物信息学实验室工作台,台上放着无标签的透明玻璃器皿,背景是整面墙的巨大发光知识网络图谱,青色与紫色光点由细线连接成密集结构

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

9月16日,《自然》发表斯坦福大学团队的论文《Reimagining research papers as interactive and reliable AI agents》,提出 Paper2Agent 框架:把论文正文、补充材料、数据集与代码库自动转换为一个 Model Context Protocol(MCP)服务器,任何兼容 MCP 的智能体都能用自然语言调用论文里的方法。作者把这个结果称为虚拟通讯作者。

系统由 Claude Code 的 agent SDK 驱动,一个中心编排器调度多个专门子智能体完成六步转换:定位并下载代码库、构建隔离运行环境、扫描并索引可用教程、端到端执行教程并记录参考输出、把教程封装为带参数的 MCP 工具并逐项验证、最后组装成单个可部署的 MCP 服务器。服务器对外暴露三层:可执行的工具、承载论文与数据链接的资源,以及固化多步流程顺序的提示。

  • 验证门槛:数值输出需在约3%容差内匹配,图像需通过感知哈希比对(汉明距离小于20),每个函数最多尝试6次,反复失败的工具被剔除
  • 成本实测:为 AlphaGenome 论文构建22个工具耗时约45分钟、花费14美元,22个工具全部自动通过验证
  • 生物医学案例:为 Scanpy 生成7个通过验证的工具,约45分钟、13美元,在4个公开单细胞数据集上与人工研究者结果一致

关键数据与争议案例

在与人工执行、Claude Code 直连仓库、以及另一款生物医学AI智能体 Biomni 的对照中,Paper2Agent 在教程类问题上得分98.7%,在新问题上100%;Claude Code 直连仓库分别为82.7%与78.7%,Biomni 为37.3%与56.0%。中位运行时间相比直连仓库快1.9倍,相比 Biomni 快3.1倍。规模化测试中,100篇 bioRxiv 计算生物学论文有74篇完成智能体化,599个候选工具中593个通过验证;300道题上准确率91.2%,单题成本0.20美元、耗时1.6分钟,对照组为0.38美元、4.3分钟。

论文还给出一个耐人寻味的案例:AlphaGenome 智能体在分析 LDL 胆固醇相关位点时把 SORT1 排在首位,而原论文更强调 CELSR2 与 PSRC1,三个基因都有较高的预测分数与显著 eQTL。作者强调,这属于可供优先验证的候选排序,不是已完成的因果证明,湿实验仍然不可省略。

对企业与科研工程的意义

  • 可复现性前置:把能跑通变成生成环节的硬门槛,而不是交给读者事后排查环境依赖
  • 流程即知识:把先质控、再归一化、再降维、再聚类这类隐含顺序显式写入提示,减少模型自由发挥
  • 跨论文协作:AlphaGenome 与 MPRA-scCRISPRi、CD4+ T 细胞 Perturb-seq 三个智能体被串联,交叉比对预测与实验数据后把 GPR137 列为银屑病位点的候选因果基因
  • 可用性:代码以 MIT 许可开源,AlphaGenome、Scanpy、TISSUE 三个服务器已托管在 Hugging Face Spaces

局限

输入质量决定上限:没有可运行代码、数据或清晰教程的论文只能停留在资源层。验证范围仍受原教程限制,测试通过不等于在新数据、不同硬件或不同依赖版本上同样可靠。此外,自然语言接口可能掩盖过滤阈值、参考基因组与随机种子等关键参数,跨论文协作产出的假设也尚未自动闭环,仍需实验验证。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。