AI用两天想出科学家十年的结论!谷歌DeepMind看到最大瓶颈
Agent 正在把科学变成一台高速运转的猜想机器但物理世界的验证速度跟不上同行评审跟不上数据基础设施也跟不上。新的瓶颈正在产生我们应该如何应对AI 让科学猜想变得廉价但验证依然昂贵这个差距正在撕裂整个科研体系。Google DeepMind 发布报告《Conjecture Machines: AI agents and the new validation bottleneck in science》10位研究员和工程师坐下来聊了一个问题AI Agent 涌入科学界之后接下来会发生什么在过去一年里Agent 已经改变了编程的意义。而科学研究可能就是下一步要被改变的领域。Agent 正在把科学变成一台高速运转的猜想机器但物理世界的验证速度跟不上同行评审跟不上数据基础设施也跟不上。新的瓶颈正在产生我们应该如何应对一夜赶超十年功故事从伦敦帝国理工学院的微生物学家 José Penadés 讲起。他的团队花了将近10年研究一类超级细菌如何传播抗生素耐药性。结论有了但一直没发表只有实验室内部知道。2024年他把问题描述给了 Google DeepMind 的 Co-Scientist一个 AI Agent。两天后Co-Scientist 返回5个可能的解释按优先级排序。排第1的跟 Penadés 团队花10年证明的假设一模一样某些超级细菌从病毒那里获取尾巴用这些尾巴当钥匙在不同宿主物种之间跳跃。Penadés 愣住了。他第一反应是电脑被人入侵了赶紧发邮件给 Google 确认。对方回复没人偷看。一个基于 LLM 的系统被赋予目标和工具能自己规划步骤、并行调度多个子任务、发现并纠正错误还能调用外部数据库、写代码操作机器人。跟聊天机器人不同Agent 不是问一句答一句它拿到目标后会自己拆解、执行、迭代。为什么现在突然好用了报告归结为三股力量。前沿模型更强了。顶级模型在 Humanitys Last Exam、FrontierMath 这类高难度科学基准上已经超过人类专家。更关键的是推理时计算inference-time reasoning带来的深度思考能力模型会一步步推演、探索、修正再给出答案。脚手架scaffolding成熟了。这是一套包裹在模型外面的代码框架给 Agent 提供结构、记忆和工具调用能力。早期脚手架是定制的换个模型就不灵了。现在有了 Agent 间通信协议等新标准通用性好了很多。可定制性来了。Agent 技能skills让科学家把自己的方法论、流程偏好写成简单的文本指令Agent 就能按你的方式干活。计算生物学家 Natasha Latysheva 说她已经把自己的研究流程提炼成了技能。她的预判是科研工作会从亲手执行转向高层编排。每天上班先看看 Agent 昨晚跑了哪些实验和分析调整方向引导注意力。猜想廉价验证昂贵Agent 对科学最直接的改变你多了一个永不知疲倦的数字助手。文献梳理、数据库查询、数据分析、写基金申请以前花几小时几天的事现在几分钟搞定。但真正结构性的变化在别处。斯坦福大学的 Gary Peltz 研究肝纤维化每年140万人死于肝硬化。他凭自己的文献积累和几十年经验挑了2个候选药物做实验。同时他让 Co-Scientist 也挑。AI 挑了3个。结果 Peltz 自己选的2个在活体人类肝细胞实验中毫无效果。Co-Scientist 选的3个里2个不仅阻断了纤维化还促进了肝细胞再生。Co-Scientist 的工作方式是调度一群子 Agent生成多样假设、互相批评、排序、迭代模拟一个人类研究小组的运作方式但速度快得多。报告也坦承 Agent 的软肋。Co-Scientist 负责人 Vivek Natarajan 说输出第10页里一个编造的事实就能毁掉整份报告。漏掉这种错误浪费时间和资源抓住它需要一个领域专家。他提出一个关键概念叫认知谦逊epistemic humility模型得知道自己不知道什么并且说出来。AlphaFold 之所以受信赖部分原因是它会报告每个预测的置信度。但在更开放的科学推理中校准这种置信度仍是未解难题。科学家同时想要两样东西基于文献、没有错误的假设以及真正新颖的想法。Agent 调得谨慎就趋向安全和已知调得大胆就容易跑偏。在搜索最优解方面AlphaEvolve 是另一个代表。给它一个用代码表达的问题和一个评分函数它调度一组 Agent 生成大量候选方案留下得分最高的用幸存者繁殖下一代。无人值守地跑规模远超人类团队。它帮 Google 设计了下一代 TPU 芯片帮数学家 Terence Tao 解决了开放的 Erdős 问题改进了基因组数据分析。在材料科学等领域AlphaEvolve 的 top 选手只是线索不是最终结果。一个有前途的催化剂还是得在实验台上造出来、测一测。这就引出了报告最核心的判断。Karl Popper 说科学通过猜想与反驳前进。AI Agent 正在改变这对关系的经济学。猜想变得丰富且廉价反驳依然是物理的、制度性的所以昂贵且缓慢。数学和计算机科学是例外验证可以在硅基世界里完成。Agent 生成证明用 Lean 这类形式语言表示计算机就能无歧义地验证对错。今年2月数学家们办了首届 First Proof 挑战10个研究问题刻意不发表确保不在任何训练数据里。给一周时间。Aletheia一个把证明生成器和自然语言验证器配对的系统解决了6个是最好成绩。但数学家们已经开始抱怨 AI 生成的证明太长、难以消化。领导 Aletheia 项目的 Thang Luong 说我们正在走向一个严重的证明消化不良的未来AI 产出突破的速度超过人类审阅的速度。而在大多数学科验证鸿沟正在扩大。Agent 可以提出一个逆转细胞衰老的基因线索但没法确定它到底管不管用。细胞系需要时间生长化学反应需要时间完成。对大部分科学来说实验室设定了节奏。基础设施该升级了报告给政策制定者和科研资助机构提了4个紧迫优先级。确保科学家能用上 Agent。报告把这比作历史上提供超级计算机访问权的挑战。地缘政治讨论总聚焦于一个国家能不能训练自己的前沿模型但更少有人关注一个可能更重要的问题一个国家能不能把 Agent 部署到整个科学生态中。资助机构得决定实验室怎么选 Agent、怎么付费。计算开销大Agent 能力边界不断扩展总花费大概率会涨。需要新的公私合作模式美国的 Genesis Mission 是一个有希望的样板。让国家数据资产对 Agent 友好。开放或低风险数据应该通过文档完善的 API 暴露给 Agent。敏感数据集比如基因组学、病毒学领域有双重用途风险的数据需要开发类似 OpenSAFELY 那样的隐私保护方案让 Agent 也能安全访问。解决验证瓶颈。Agent 让假设越来越多实验设施的时间却就那么多。报告建议投资现有实验验证设施并开放共享同时加速自动化实验室建设。给同行评审配上 Agent。科学家已经在用 AI 写越来越多的基金申请和论文写作质量不再是可靠的区分标准。Agent 越深度参与规划和优化申请申请书就越少反映科学家的原创思考。报告建议分层应对使用者更清晰地记录 AI 参与情况推进水印技术和 Human-AI Interaction Cards人机交互卡片记录产生关键科学洞见的提示和输出。审稿人也应该能用 Agent先在检测错误这类客观领域试点。AI Agent 不能成为少花钱搞科学的理由那将是一个悲剧性的虚假节约。把这一刻当作真正结构性变化的国家才能释放最大的公共价值。这个窗口期的选择可能很难逆转。科学家用上 Agent 之后不会再回头了。技术会继续进步。但管理科学的那些制度实验室、团队、机构、同行评审、资助体系是为一个正在被加速的科研企业建造的它们自己还没跟上。

相关新闻

OpenZFS开发者入门:如何为开源存储系统贡献代码

OpenZFS开发者入门:如何为开源存储系统贡献代码

OpenZFS开发者入门:如何为开源存储系统贡献代码 【免费下载链接】openzfs OpenZFS on Linux and FreeBSD 项目地址: https://gitcode.com/gh_mirrors/op/openzfs OpenZFS是一款强大的开源存储系统,广泛应用于Linux和FreeBSD平台。作为开发者&…

2026/7/21 19:56:52 阅读更多 →
Node-COBOL生产环境部署:最佳实践与注意事项

Node-COBOL生产环境部署:最佳实践与注意事项

Node-COBOL生产环境部署:最佳实践与注意事项 【免费下载链接】node-cobol :tv: COBOL bridge for NodeJS which allows you to run COBOL code from NodeJS. 项目地址: https://gitcode.com/gh_mirrors/no/node-cobol 在现代企业应用中,将遗留的C…

2026/7/21 19:56:52 阅读更多 →
Chronotrains未来路线图:功能规划与社区发展展望

Chronotrains未来路线图:功能规划与社区发展展望

Chronotrains未来路线图:功能规划与社区发展展望 【免费下载链接】chronotrains Shortest times between train stations in Europe 项目地址: https://gitcode.com/gh_mirrors/ch/chronotrains Chronotrains作为一款创新的欧洲火车等时线地图工具&#xff0…

2026/7/21 19:56:52 阅读更多 →

最新新闻

[人工智能]生成式AI开源生态:库、工具与工作流

[人工智能]生成式AI开源生态:库、工具与工作流

生成式AI开源生态:库、工具与工作流本文介绍生成式AI相关的开源生态,包括核心库、社区项目以及配套工具,并讨论典型工作流和工程实践注意事项。文档配有示意图和表格,适合作为超过4页的技术参考资料。图1:若干生成式AI…

2026/7/21 23:12:56 阅读更多 →
自主AI智能体开发指南:从原理到实践

自主AI智能体开发指南:从原理到实践

1. 自主AI智能体的定义与核心特征自主AI智能体(Autonomous AI Agent)是能够独立感知环境、制定决策并执行多步骤任务的智能系统。与传统的自动化工具不同,这些智能体具备三个关键特征:目标导向性:基于预设目标自主规划…

2026/7/21 23:12:56 阅读更多 →
[人工智能]生成式AI:模型、应用与流程

[人工智能]生成式AI:模型、应用与流程

生成式AI:模型、应用与流程本文系统介绍生成式AI的主要模型类型、应用场景以及工程流程,并通过若干示意图和表格展开说明。文档内容适合形成超过4页的技术参考,用于教学或工程背景说明。图1:GAN中生成器与判别器损失随迭代轮次变化…

2026/7/21 23:12:56 阅读更多 →
Claude Code 实战指南:AI 结对编程从安装到项目实战

Claude Code 实战指南:AI 结对编程从安装到项目实战

在实际开发中,我们经常需要快速理解一个陌生项目的结构、修复一个棘手的 Bug,或者为一个新功能编写样板代码。这些任务虽然不复杂,但会打断深度思考的“心流”状态。Claude Code 正是为了解决这类问题而生的 AI 编码助手,它不是一…

2026/7/21 23:12:56 阅读更多 →
转:为何许多人都说,“不想活成父母的样子”?

转:为何许多人都说,“不想活成父母的样子”?

个人理解: 立志远离父母糟糕的相处方式,组建家庭后,指责、冷战却不断重现 我们总是在伴侣身上寻找父母的影子 把偏见变成自己的常识 制造新经验,用新的经验去替代旧的经验 选择留下哪些、放下哪些,从而创造出一种新的经…

2026/7/21 23:12:56 阅读更多 →
[Android] 时光邮局1.0.2 -送给未来自己的一封信

[Android] 时光邮局1.0.2 -送给未来自己的一封信

[Android] 时光邮局1.0.2 -送给未来自己的一封信 链接:https://pan.xunlei.com/s/VOy1cjq-16u9pfYr_BEvK8L_A1?pwd6ery# 一款纯净无广自由操作性很强的软件,可以给未来自己写一封信,并设置打开日期,

2026/7/21 23:11:55 阅读更多 →

日新闻

Octane Render与C4D汉化版安装与优化指南

Octane Render与C4D汉化版安装与优化指南

1. Octane Render与C4D的黄金组合:为什么选择这个方案?在三维创作领域,渲染器的选择往往决定了作品的最终呈现质量和工作效率。作为Cinema 4D(C4D)用户,Octane Render的GPU加速特性与实时预览功能&#xff…

2026/7/21 0:00:19 阅读更多 →
GPMC接口设计:异步/同步模式与多路复用配置实战

GPMC接口设计:异步/同步模式与多路复用配置实战

1. GPMC接口设计:从硬件连接到软件配置的全局视角在嵌入式系统开发中,尤其是基于TI Sitara系列如AM263x这类高性能微控制器的项目里,外部存储器的扩展几乎是绕不开的一环。无论是存放大量非易失性代码的NOR Flash,还是作为高速数据…

2026/7/21 0:00:19 阅读更多 →
UE5 GAS框架下RPG被动技能系统:从核心原理到实战实现

UE5 GAS框架下RPG被动技能系统:从核心原理到实战实现

1. 项目概述:UE5 GAS RPG被动技能的核心价值在UE5里用GAS(Gameplay Ability System)做RPG游戏,主动技能像是你手里的武器,按一下打一下,逻辑直接,反馈也快。但被动技能,它更像是你身…

2026/7/21 0:00:19 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 8:48:31 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 8:25:39 阅读更多 →

月新闻