视频亮点
xAI 小团队在三个月内从零构建了 Grok Imagine 图像和视频模型
视频模型可能成为 AI 的前端,生成式 UI 将取代传统界面
未来视频生成可能更多依赖语言模型和 Agent,而非仅依靠扩散模型
每天精选值得关注的 AI 动态
xAI 小团队在三个月内从零构建了 Grok Imagine 图像和视频模型
视频模型可能成为 AI 的前端,生成式 UI 将取代传统界面
未来视频生成可能更多依赖语言模型和 Agent,而非仅依靠扩散模型
本期节目邀请了 Ethan He,他曾在 NVIDIA 参与 Cosmos 世界模型的构建,后加入 xAI 从零到一打造了 Grok Imagine 图像和视频生成模型。Ethan 分享了他在 xAI 三个月内交付首个多模态视频模型的经验,核心是快速迭代与基础设施。他认为模型开发中最大的提升往往来自修复数据管道里的小 bug,而不是算法创新。
Ethan 深入拆解了视频模型的训练流程:从图像模型出发,通过 VAE 进行空间压缩,再用扩散 Transformer 处理时序,音频-视频对齐比文本-视频对齐更难。他还讨论了推理加速的手段,包括步蒸馏、一致性模型和 GAN,以及实时视频生成与交互性之间的权衡。
关于世界模型,Ethan 的定义是:实时、交互、长程的视频生成。他区分了视频生成模型(如 Grok Imagine)和世界模型(如 Cosmos),后者需要支持真实物理交互。他认为未来视频模型可能成为 AI 的前端,生成式 UI 将取代传统界面,用户意图直接到像素。
Ethan 还介绍了 xAI 的文化:第一性原理、快速行动、减少会议。他提到与 Elon Musk 工作的特点——决策快,但沟通成本高。他也解释了为何离开 xAI,转而更关注 LLM 的自管理上下文和记忆机制。
最后,他预测视频 Agent 和语言模型将解锁视频生成的下一个浪潮,因为语言模型能提供更好的指令理解和提示改写。他也提到了 AI 安全与 SynthID 水印技术,以及未来机器人从视频世界模型学习物理交互的可能性。
本期节目邀请了 Ethan He,他曾在 NVIDIA 参与 Cosmos 世界模型的构建,后加入 xAI 从零到一打造了 Grok Imagine 图像和视频生成模型。Ethan 分享了他在 xAI 三个月内交付首个多模态视频模型的经验,核心是快速迭代与基础设施。他认为模型开发中最大的提升往往来自修复数据管道里的小 bug,而不是算法创新。
Ethan 深入拆解了视频模型的训练流程:从图像模型出发,通过 VAE 进行空间压缩,再用扩散 Transformer 处理时序,音频-视频对齐比文本-视频对齐更难。他还讨论了推理加速的手段,包括步蒸馏、一致性模型和 GAN,以及实时视频生成与交互性之间的权衡。
关于世界模型,Ethan 的定义是:实时、交互、长程的视频生成。他区分了视频生成模型(如 Grok Imagine)和世界模型(如 Cosmos),后者需要支持真实物理交互。他认为未来视频模型可能成为 AI 的前端,生成式 UI 将取代传统界面,用户意图直接到像素。
Ethan 还介绍了 xAI 的文化:第一性原理、快速行动、减少会议。他提到与 Elon Musk 工作的特点——决策快,但沟通成本高。他也解释了为何离开 xAI,转而更关注 LLM 的自管理上下文和记忆机制。
最后,他预测视频 Agent 和语言模型将解锁视频生成的下一个浪潮,因为语言模型能提供更好的指令理解和提示改写。他也提到了 AI 安全与 SynthID 水印技术,以及未来机器人从视频世界模型学习物理交互的可能性。