从研究到现实:DeepMind VP谈代码生成与模型推理

视频亮点

4:43

代码语法生成时代已结束,瓶颈转向架构与验证

9:36

自对弈能让模型自己生成并验证问题,达到超人类性能

13:48

归纳架构将使模型从token预测转向规划与跨域知识迁移

⭐⭐⭐⭐ 4.2

Benoit Schillings,Google DeepMind 技术副总裁,曾作为 CTO 领导 X 实验室的 moonshot 项目,如今带队 DeepMind 的思考、推理和编程团队。他在本次演讲中直面 AI 从研究到落地的核心挑战,指出代码生成不再是瓶颈,语法生成时代已经结束,真正的瓶颈转向系统架构设计、验证和安全性。他同时分享了 DeepMind 在训练模型方面的前沿进展,特别是自对弈(self-play) 如何推动模型在推理任务上超越人类水平。

最值得记录的观点有三个。首先,[Benoit] 强烈认为人类生成训练数据即将饱和,自对弈是模型达到超人类性能的关键路径——模型自己生成问题、自己验证答案,像 AlphaGo 那样通过自我对弈不断进化。其次,他反对将 AI 代码生成视为简单补全工具,强调当写代码几乎免费时,软件工程的焦点必须转向“治理”,即建立主动的防护栏和安全体系来管理代码量的爆炸性增长。最后,他预测下一代模型架构将从简单的 token 预测转向归纳架构(inductive architecture),使模型能够规划、分解复杂问题并在不同领域之间迁移知识,这将是迈向通用推理的重要一步。

最值得持续关注的趋势是自对弈方法的泛化应用。如果 DeepMind 成功将这一方法从代码和棋类扩展到科学发现领域,AI 将能在化学和生物实验中快速探索海量可能性,发现人类无法直接观察的隐藏模式。此外,模型评估基准也必须从当前简单的任务级测试走向更复杂的推理和规划评估,以真正衡量模型的思考能力。这些方向不仅影响 DeepMind 的路线图,也可能重新定义整个行业对“智能”的衡量标准,值得所有 AI 从业者密切关注。

Benoit Schillings,Google DeepMind 技术副总裁,曾作为 CTO 领导 X 实验室的 moonshot 项目,如今带队 DeepMind 的思考、推理和编程团队。他在本次演讲中直面 AI 从研究到落地的核心挑战,指出代码生成不再是瓶颈,语法生成时代已经结束,真正的瓶颈转向系统架构设计、验证和安全性。他同时分享了 DeepMind 在训练模型方面的前沿进展,特别是自对弈(self-play) 如何推动模型在推理任务上超越人类水平。

最值得记录的观点有三个。首先,[Benoit] 强烈认为人类生成训练数据即将饱和,自对弈是模型达到超人类性能的关键路径——模型自己生成问题、自己验证答案,像 AlphaGo 那样通过自我对弈不断进化。其次,他反对将 AI 代码生成视为简单补全工具,强调当写代码几乎免费时,软件工程的焦点必须转向“治理”,即建立主动的防护栏和安全体系来管理代码量的爆炸性增长。最后,他预测下一代模型架构将从简单的 token 预测转向归纳架构(inductive architecture),使模型能够规划、分解复杂问题并在不同领域之间迁移知识,这将是迈向通用推理的重要一步。

最值得持续关注的趋势是自对弈方法的泛化应用。如果 DeepMind 成功将这一方法从代码和棋类扩展到科学发现领域,AI 将能在化学和生物实验中快速探索海量可能性,发现人类无法直接观察的隐藏模式。此外,模型评估基准也必须从当前简单的任务级测试走向更复杂的推理和规划评估,以真正衡量模型的思考能力。这些方向不仅影响 DeepMind 的路线图,也可能重新定义整个行业对“智能”的衡量标准,值得所有 AI 从业者密切关注。

Research to Reality with Google DeepMind — Benoit Schillings, Google DeepMind, VP of Technology

查看原文