Ethan He 谈 xAI 构建 Grok Imagine 与视频生成未来

视频亮点

00:04:40

xAI 小团队在三个月内从零构建了 Grok Imagine 图像和视频模型

00:23:26

视频模型可能成为 AI 的前端,生成式 UI 将取代传统界面

01:14:26

未来视频生成可能更多依赖语言模型和 Agent,而非仅依靠扩散模型

⭐⭐⭐⭐✨ 4.5

本期节目邀请了 Ethan He,他曾在 NVIDIA 参与 Cosmos 世界模型的构建,后加入 xAI 从零到一打造了 Grok Imagine 图像和视频生成模型。Ethan 分享了他在 xAI 三个月内交付首个多模态视频模型的经验,核心是快速迭代与基础设施。他认为模型开发中最大的提升往往来自修复数据管道里的小 bug,而不是算法创新。

Ethan 深入拆解了视频模型的训练流程:从图像模型出发,通过 VAE 进行空间压缩,再用扩散 Transformer 处理时序,音频-视频对齐比文本-视频对齐更难。他还讨论了推理加速的手段,包括步蒸馏、一致性模型和 GAN,以及实时视频生成与交互性之间的权衡。

关于世界模型,Ethan 的定义是:实时、交互、长程的视频生成。他区分了视频生成模型(如 Grok Imagine)和世界模型(如 Cosmos),后者需要支持真实物理交互。他认为未来视频模型可能成为 AI 的前端,生成式 UI 将取代传统界面,用户意图直接到像素。

Ethan 还介绍了 xAI 的文化:第一性原理、快速行动、减少会议。他提到与 Elon Musk 工作的特点——决策快,但沟通成本高。他也解释了为何离开 xAI,转而更关注 LLM 的自管理上下文和记忆机制。

最后,他预测视频 Agent 和语言模型将解锁视频生成的下一个浪潮,因为语言模型能提供更好的指令理解和提示改写。他也提到了 AI 安全与 SynthID 水印技术,以及未来机器人从视频世界模型学习物理交互的可能性。

本期节目邀请了 Ethan He,他曾在 NVIDIA 参与 Cosmos 世界模型的构建,后加入 xAI 从零到一打造了 Grok Imagine 图像和视频生成模型。Ethan 分享了他在 xAI 三个月内交付首个多模态视频模型的经验,核心是快速迭代与基础设施。他认为模型开发中最大的提升往往来自修复数据管道里的小 bug,而不是算法创新。

Ethan 深入拆解了视频模型的训练流程:从图像模型出发,通过 VAE 进行空间压缩,再用扩散 Transformer 处理时序,音频-视频对齐比文本-视频对齐更难。他还讨论了推理加速的手段,包括步蒸馏、一致性模型和 GAN,以及实时视频生成与交互性之间的权衡。

关于世界模型,Ethan 的定义是:实时、交互、长程的视频生成。他区分了视频生成模型(如 Grok Imagine)和世界模型(如 Cosmos),后者需要支持真实物理交互。他认为未来视频模型可能成为 AI 的前端,生成式 UI 将取代传统界面,用户意图直接到像素。

Ethan 还介绍了 xAI 的文化:第一性原理、快速行动、减少会议。他提到与 Elon Musk 工作的特点——决策快,但沟通成本高。他也解释了为何离开 xAI,转而更关注 LLM 的自管理上下文和记忆机制。

最后,他预测视频 Agent 和语言模型将解锁视频生成的下一个浪潮,因为语言模型能提供更好的指令理解和提示改写。他也提到了 AI 安全与 SynthID 水印技术,以及未来机器人从视频世界模型学习物理交互的可能性。

Inside xAI: Building Grok Imagine in 3 Months, Videogen vs World Models, and Video Agents— Ethan He

查看原文