请添加图片描述

DeepMind 在 5 月 7 日发布 AlphaEvolve 的一周年影响力报告:这套以 Gemini 为大脑的"进化式编码代理"已从论文走进生产线,在基因组纠错(变异检测误差降 30%)、电网最优潮流(可行解率从 14% 升到 88%)、量子电路(误差降一个数量级)、TPU 电路设计、数据库与编译器等场景落地。本文拆解它的工作机理——LLM 提出代码变异 + 自动评测 + 进化选择的闭环——并讨论它和传统 AutoML / 神经架构搜索(NAS)的本质区别,以及"算法自我进化"叙事的边界。

1. AlphaEvolve 到底是什么

回到 2025 年 5 月,DeepMind 首次提出 AlphaEvolve:一个用 Gemini 设计高级算法的编码代理。它的定位不是"再训练一个更大的模型",而是把大模型当成变异算子塞进一个进化循环里。

它的核心闭环可以拆成四步:

  1. 种群(population):维护一批候选程序,每个候选都是一段真实可运行的代码(不是伪代码,也不是一段权重)。
  2. 变异(mutation):用 Gemini 读现有候选,提出有针对性的修改——可以是改一个启发式、换一种数据结构、调一段循环,甚至重写整个函数。
  3. 评测(evaluation):把改完的程序放进一个可自动打分的评测器里跑,得到一个客观分数(速度、误差、可行解率等)。
  4. 选择(selection):按分数留下更优的候选,作为下一轮变异的父代,如此反复,过夜跑成千上万代。

这套结构的精髓在于:它只需要一个能自动评分的目标函数,就能把"写代码找更优算法"变成一个可被搜索的优化问题。LLM 负责"产生有品味的猜测",评测器负责"无情地证伪",进化循环负责"把好猜测沉淀下来"。这也是它和昨天那篇里聊过的 Karpathy autoresearch 思路相通的地方——固定预算 + 单一指标 + 自动迭代——但 AlphaEvolve 把适用域从"训一个小模型"推广到了任意"能打分的算法问题"。

2. 这一年它真正改了什么

一周年报告最值得算法工程师注意的,不是宣传话术,而是一串带数字、且大多挂着 arXiv 或合作方背书的硬结果:

基础设施与系统。 AlphaEvolve 已成为 Google 内部常规工具。它为下一代 TPU 提出了一个"反直觉但高效"的电路设计,并被直接写进了硅片;它发现的缓存替换策略,两天就做完了过去需要数月人力的工作;它优化 Spanner 的 LSM-tree 压实启发式,把写放大(write amplification)降了 20%;还给出新的编译器优化思路,让软件存储占用减少近 9%。

科学与工程。 在基因组学里,它改进了 Google Research 的 DeepConsensus 模型,使 DNA 变异检测误差降低 30%,已被 PacBio 用于实际测序;在电网领域,它把 GNN 求解交流最优潮流(AC Optimal Power Flow,见 arXiv:2403.17660)的可行解率从 14% 拉到 88% 以上;在量子物理里,它给出的量子电路误差比传统优化基线低约 10 倍,让复杂分子模拟得以在 Google 的 Willow 量子处理器上跑起来。它还在旅行商问题(TSP)和拉姆齐数(Ramsey numbers)等经典难题上刷新了下界——这一点已有 Terence Tao 等数学家参与验证。

商业落地。 Klarna 用它把一个大型 Transformer 的训练速度翻倍且质量更好;FM Logistic 把仓储级 TSP 路由效率提升 10.4%,一年省下 1.5 万公里行驶距离;Schrödinger 在机器学习力场(MLFF)的训练与推理上拿到约 4 倍加速。

把这些放在一起看,关键信号是:AlphaEvolve 输出的不是"模型权重",而是可读、可审计、可直接合入生产代码库的算法。这让它的成果天然具备可移植性和可解释性——一段更优的压实启发式,工程师能读懂、能 review、能回滚。

3. 它和 AutoML / NAS 有什么本质不同

很多人第一反应是:"这不就是 AutoML 或神经架构搜索换皮吗?"差别其实很本质。

搜索空间不同。 传统 NAS 在一个预先定义好的、结构化的空间里搜(比如层数、卷积核大小、连接方式)。AlphaEvolve 的搜索空间是"任意源代码"——它能改的不是几个超参,而是程序的逻辑本身。这把搜索从"在给定积木里拼"扩展到了"重新设计积木"。

变异算子不同。 NAS 通常用强化学习或进化算法在离散选项上采样,变异是"随机+无语义"的。AlphaEvolve 的变异算子是 LLM,它带着对代码语义的理解去改——更像一个会读注释、懂上下文的工程师在做有方向的尝试,而不是盲目掷骰子。

产物不同。 NAS 产出一个网络结构,最终还是黑箱权重。AlphaEvolve 产出的是人类可读的算法描述,能被直接审查、嵌入现有系统、跨任务复用。

所以更准确的类比是:AlphaEvolve = 进化算法的框架 + LLM 作为"有品味的变异源" + 一个严格的自动评测器。它的能力上限,几乎完全由"你能不能为目标写出一个可靠、可自动跑的评分函数"决定。

4. 边界与冷思考

报告里 Jeff Dean 那句"TPU 大脑帮忙设计下一代 TPU 身体"很有传播力,但工程上要保持清醒。

第一,它不是无条件的自我改进。AlphaEvolve 的每一步进步,都依赖一个人类设计、且确实可信的评测器。评测器写歪了,进化只会高效地朝错误方向跑——这正是这类系统最大的工程风险,也是为什么它目前的战果都集中在"目标明确、可量化"的问题上。

第二,它擅长"优化已知目标",不擅长"定义值得优化的目标"。给定一个清晰的打分函数,它能找出惊艳的解;但"该优化什么"这一步,仍然是人类研究品味的领地。

第三,可复核仍是底线。无论是数学下界还是芯片电路,最终拍板的都是人类专家的验证流程。AlphaEvolve 把"产出候选"的成本压到接近于零,于是瓶颈正在从"想不出来"转移到"验证得过来吗"。

对算法工程师,真正可操作的启示是:与其等一个通用代理,不如先盘点自己手上哪些问题"能写出可靠的自动评分器"。那些问题,就是进化式代理今天就能帮你啃的硬骨头。

参考资料

  • AlphaEvolve 一周年影响力报告 — https://deepmind.google/blog/alphaevolve-impact/
  • AlphaEvolve 首发博客(架构与机制)— https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/
  • AC Optimal Power Flow 相关工作 — https://arxiv.org/abs/2403.17660
Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐