Project Pilot:AI模型能否操控无人机?

AnthropicAndon Labs 合作开展了 Project Pilot,测试 AI 模型控制四旋翼无人机在室内完成定位并跟踪特定人员的任务。该任务被分解为五个子任务:Reconstruct(从视频重建3D模型并生成2D障碍地图)、Localize(将无人机当前视角匹配到地图上定位自身)、Navigate(规划路径并飞行,同时持续调用 Localize 修正位置)、Detect(从参考照片构建检测器,在视频流中找出目标并返回边界框)、Follow(根据边界框控制无人机保持目标在画面中央且距离稳定)。为了快速迭代,他们将这些子任务分别用软件模拟复现,并建立了一个性能基线:由人类+AI编码团队为每个子任务开发算法,组合起来实现端到端成功。

Andon 测试了来自三个开发商的 15 个模型,包括 GPT-4o、o1、o3、Claude Opus 4、Gemini 2.5 Pro、GPT-5、Fable 5 等。整体趋势是越新的模型在所有子任务上得分越高,其中检测和跟踪表现最好,而重建和定位最困难。当前最强模型 Claude Fable 5 在除 Reconstruct 外的所有子任务上均超过了基线。在真实无人机上端到端执行时,Fable 5 的检测和跟踪表现明显优于基线算法,但由于重建错误导致定位和导航失败,无法自主在房间之间移动(例如将墙壁误认为门)。

一个值得注意的细节:Fable 5 在提交代码前会进行局部分析。在一次运行中,它通过分析模拟视频中的地板缝隙线恢复场景消失点,自主估算出无人机相机的外参,倾斜角度误差在4度以内。另一次运行中,它自己构建了一个2D俯视图来本地测试 Follow 任务,虽然该环境与现实不同,但帮助它捕获了早期 bug。

一致性方面仍有差距。在10次模拟中,模型在5个子任务中的4个上至少有一次达到人类基线;但即使是 Fable 5,平均也只有3个子任务达标。前沿模型的一次性最好能力大约比其一致性表现领先 6个月——Fable 5 当前的平均性能相当于2026年初其他模型的一次性最佳水平。

实验有其局限性:无人机移动速度慢,仅在一个办公室楼层平面、有限人数下测试,且未在户外或人群中进行。但项目通过分解任务追踪了能力提升轨迹,并指出:一旦模型在可靠性和能力上超过“人类+AI团队”基线,将面临减少人类监督的压力。这尤其涉及物理安全和隐私的领域,需要审慎决策。Anthropic 强调,随着能力规模扩大,对齐、治理和安全投入也应增加。

Project Pilot: Can AI models fly drones?

查看原文