OpenAI 竞赛中 AI Agent 是如何成为第一贡献者的

视频亮点

0:00

Aiden 在 22 天内完成了 7 项合并记录,是任何人类贡献者的两倍以上。

4:01

Agent 的核心优势是执行效率与搜索覆盖,而非提出颠覆性洞见。

10:04

未来的科研方式是:人定方向与约束,Agent 暴力执行并反馈结果。

⭐⭐⭐⭐ 4.2

Weco AI 的 CEO Zhengyao Jiang 在 2026 年的一场技术大会上,复盘了他们的自主研究 Agent Aiden 如何在 OpenAI 举办的「Parameter Golf」模型训练竞赛中,击败了超过 1000 名人类研究员,成为社区中被引用次数最多的贡献者。核心问题是:AI Agent 能否在开放研究社区中产出超越人类的、可复用的研究成果?Aiden 最终斩获了 7 项合并记录,比第二名人类参与者多出一倍以上,而 OpenAI 却因为它的「非人类」身份无法录用它。

[Zhengyao Jiang] 认为,Agent 的优势不在于提出颠覆性洞见,而在于极致的执行效率搜索覆盖Aiden 能在 22 天内迭代数千次实验,系统地探索架构、分词器、数据管线的组合空间,这是人类团队做不到的。他强调人类设计(如奖励函数、搜索空间)仍然是 Agent 的上限来源,反对将 Agent 视为「万能研究员」。他预测,未来的科研不是人 vs AI,而是「人设定研究方向与约束,Agent 暴力执行并反馈结果」的协作范式。[Jiang] 用 Andrej Karpathy 的类比总结:人类写代码就像手动梯度下降,而 Agent 才是真正的自动微分——重点从写代码转向定义「eval」和设计抽象接口。

值得持续关注的趋势是:AI 驱动的科研将彻底改变「贡献」的定义。Parameter Golf 社区中,许多人类参与者的最佳成果来自直接或间接复用 Aiden 的实验结果,这构成了 Jiang 所说的「人类-AI 协作的自然实验」。当 Agent 能像工程脚手架一样被他人自由 fork 和扩展,传统论文的「首创性」标准可能被「可组合性与可复现性」取代。Jiang 最后指出,AI 工程师的新手艺是「为 Agent 设计高质量的 API 和评估指标」**,而不是自己动手调参——这对所有从事 AI 开发的人都意味着技能树的根本迁移。

Weco AI 的 CEO Zhengyao Jiang 在 2026 年的一场技术大会上,复盘了他们的自主研究 Agent Aiden 如何在 OpenAI 举办的「Parameter Golf」模型训练竞赛中,击败了超过 1000 名人类研究员,成为社区中被引用次数最多的贡献者。核心问题是:AI Agent 能否在开放研究社区中产出超越人类的、可复用的研究成果?Aiden 最终斩获了 7 项合并记录,比第二名人类参与者多出一倍以上,而 OpenAI 却因为它的「非人类」身份无法录用它。

[Zhengyao Jiang] 认为,Agent 的优势不在于提出颠覆性洞见,而在于极致的执行效率搜索覆盖Aiden 能在 22 天内迭代数千次实验,系统地探索架构、分词器、数据管线的组合空间,这是人类团队做不到的。他强调人类设计(如奖励函数、搜索空间)仍然是 Agent 的上限来源,反对将 Agent 视为「万能研究员」。他预测,未来的科研不是人 vs AI,而是「人设定研究方向与约束,Agent 暴力执行并反馈结果」的协作范式。[Jiang] 用 Andrej Karpathy 的类比总结:人类写代码就像手动梯度下降,而 Agent 才是真正的自动微分——重点从写代码转向定义「eval」和设计抽象接口。

值得持续关注的趋势是:AI 驱动的科研将彻底改变「贡献」的定义。Parameter Golf 社区中,许多人类参与者的最佳成果来自直接或间接复用 Aiden 的实验结果,这构成了 Jiang 所说的「人类-AI 协作的自然实验」。当 Agent 能像工程脚手架一样被他人自由 fork 和扩展,传统论文的「首创性」标准可能被「可组合性与可复现性」取代。Jiang 最后指出,AI 工程师的新手艺是「为 Agent 设计高质量的 API 和评估指标」**,而不是自己动手调参——这对所有从事 AI 开发的人都意味着技能树的根本迁移。

An AI Agent Became the #1 Contributor in OpenAI's Hiring Challenge — Zhengyao Jiang, Weco

查看原文