专家质疑白宫对Kimi K3蒸馏的指控

美国白宫科技顾问 Michael Kratsios 指控中国公司 Moonshot(Kimi K3 的开发者)通过蒸馏窃取 Anthropic 的 Fable 模型能力,并使用被禁止出口至中国的芯片训练。Kratsios 在社交媒体上称,这种大规模秘密的工业蒸馏行为窃取了美国专有技术、破坏了美国研究。他还引用财政部长 Scott Bessent 的言论,称在多个中国模型中发现了美国大语言模型的“水印”。但 Kratsios 未提供任何具体证据,也未说明水印的具体形式。

然而,多名 AI 专家对蒸馏论表示强烈质疑。Laude Institute 研究员、Snorkel AI 联合创始人 Braden Hancock 指出,从时间上就说不通——Fable 7 月 1 日才公开发布,短短两周内不可能完成大规模数据蒸馏、训练并发布一个像 Kimi K3 这样强的模型。Allen Institute for AI 研究员 Nathan Lambert 在播客中表示,随着中国模型接近前沿,蒸馏的效果正越来越弱。如果仅靠蒸馏就能成功,那么任何人都能通过蒸馏数据轻松追赶上 Kimi K3,但事实并非如此——仅靠监督微调(SFT)做不到。

蒸馏技术本身并非万能。它需要系统性地查询目标模型以生成训练数据,有时包括获取其思维链(chain-of-thought)。Lambert 认为,SFT 虽然能让模型“学会举止”,但随着模型变复杂,SFT 收益递减。要真正蒸馏出 Fable 级别的能力,需要强化学习(RL)技术——大型 RL 训练可能需要数千万 agent,用前沿实验室的 API 执行成本高到离谱且速度是瓶颈,甚至不一定能带来性能提升。

Anthropic 今年早些时候曾公开指控 MoonshotDeepSeek 和 MiniMax 系统性蒸馏其模型,称发现数百万次异常查询——通过 IP 地址和元数据识别,这些查询模式“明显不同于正常使用,反映的是刻意的能力提取”。Anthropic 未回应关于 Fable 蒸馏的最新询问。但蒸馏在 AI 行业并非中国独有。Elon Musk 今年早些时候作证称,他的公司 xAI 蒸馏了 OpenAI 的模型来开发 Grok,并称这在业内是常见做法。蒸馏与生成合成数据集之间的界限有时相当模糊。

Hancock 强调,美国人低估了中国 AI 团队的技术实力——Moonshot 的创始人之一是 CMU 博士,他们是能做扎实工作的正经研究人员和工程师。即便美国模型完全停滞,中国进步会放缓但不会停止。同时,Kratsios 指控的第二部分——Moonshot 获取了被禁运的英伟达 Grace Blackwell 300 芯片及配备 GB300 的泰国服务器——也存在争议。乔治城大学安全与新兴技术中心研究员 Sam Bresnick 指出,黑市确实存在(今年 5 月超级微电脑公司创始人就因向中国走私先进芯片被起诉),他主张全球数据中心都应实施“了解你的客户”法规,对进行大规模训练的公司强制报告机制。拜登政府商务部 2024 年曾提出类似规则,但特朗普上台后未见进展。

Experts say exploiting Anthropic's Fable isn't how Kimi K3 got so good | TechCrunch

查看原文