返回行业动态
研究前沿

谷歌DeepMind Co-Scientist升级为闭环科研系统:可操控实验设备、撰写论文,造假率从46%降至4%

Google DeepMind将Co-Scientist从假设生成工具升级为可规划实验、控制实验室设备、撰写科学论文的闭环科研系统,基于Gemini 3模型,在材料科学、生物学和计算机科学三个领域实现实验验证。

来源:THE DECODER原标题:Google Deepmind's AI Co-Scientist now plans experiments, runs lab equipment, and writes scientific papers查看原文
谷歌DeepMind Co-Scientist闭环科研系统

AI Generated by Qwen-Image-Plus

系统升级

2026年8月28日,谷歌DeepMind发表论文,展示其多智能体系统Co-Scientist的重大升级——从最初的假设生成工具,进化为能够规划实验、编写代码、控制实验室设备并撰写科学论文的闭环自主科研系统。

该系统基于Gemini 3系列模型构建,在三个学科领域展示了不同程度的自主性。

三领域验证

  • 材料科学:与半自动化高温炉配对,发现更安全的二维材料合成路径,利用Gemini 3 Deep Think直接控制设备,将配方开发时间从数天缩短至数分钟
  • 生物学:自主构建图像分析管线,预测基因工程大肠杆菌菌落的图案形成
  • 计算机科学:在几乎无人类干预的情况下,设计出名为「Agent_H」的医疗AI架构,在健康基准测试中超越GPT-5和Claude Opus 5

造假率显著降低

最引人注目的技术突破在于造假率的显著降低。通过引入验证模块——将论文中的数值声明与代码执行日志进行交叉核对——Co-Scientist的关键结果造假率从46%降至4%,而对比系统高达90%。完全伪造的数据从未出现在Co-Scientist的输出中,但对比系统44%的论文存在此问题。

局限性

然而,研究也揭示了局限性:三名执业医师评估Agent_H时,在九个评估类别中仅有一项(降低有害回答风险)显示出统计学显著优势,且自动评估器与医生判断的相关性较弱。这表明高基准分数并不等同于实际临床价值。

在AI系统能够驾驭科学的物理现实之前,还有很长的路要走。但我们对LLM帮助人类和加速现实世界进展的潜力深感兴奋。
编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。