代理串联两个Hugging Face Space,构建3D巴黎画廊

Hugging Face 发布了一篇博文,展示了一个编码代理如何通过链式调用两个 Hugging Face Space,自动构建出一个包含巴黎地标的 3D 高斯散点画廊。整个过程无需人工打开图像生成器或 3D 重建工具,代理直接调用两个 Space 的 API 完成所有资产生成和部署。

核心背景是 Mitchell Hashimoto 提出的“构建块经济”(building block economy):构建软件最有效的方式不再是打磨一个巨型单体,而是将经过验证的小组件用文档清晰暴露出来,让 AI 代理去粘合。AI 在从头写代码方面一般,但非常擅长把现成的组件拼在一起。这个理念同样适用于多媒体 AI——集成难度(SDK、权重、GPU、输入格式、轮询)远大于模型本身。

Hugging Face Spaces 正是这种构建块的理想载体。每个 Gradio Space 都自动暴露一个 plain-text 的 agents.md 文件,代理只需一行 curl 就能获取该 Space 的完整调用方式:API schema 地址、调用端点、轮询结果、文件上传方式、认证信息。无需任何客户端库或硬编码集成。真正的解锁在于链式调用:一个 Space 的输出直接成为下一个 Space 的输入。

博文的工作示例是“巴黎纪念碑 → 3D 散点”。代理链式调用了两个 Space:
ideogram-ai/ideogram4:将每个纪念碑名称转化成一张干净、黑色背景的“标本”照片(提示词控制,六张图覆盖巴黎主要地标)。
VAST-AI/TripoSplat:从单张图像重建出 3D 高斯散点(.ply 文件)。
代理还自动完成了后续粘合工作:将 TripoSplat 输出的 Y-down 坐标系翻转至直立,自动构图,将 .ply 压缩为 .ksplat(约缩小 3 倍),搭建 Three.js 查看器(支持滑动切换、拖拽旋转),最后部署为一个静态 Space。唯一的人工输入是品味层面的调整,例如“拉远一点”、“换一个更适合散点的方尖碑”。

一旦这一流水线建立,生成其他国家的画廊只需一句话:“创建一个类似的日本/埃及 Space”。代理自动完成:六张图片、六个散点、压缩、查看器、部署。边际成本降至描述成本

这种模式的意义在于:不同组织的 SOTA 图像模型和 3D 重建模型,通过 agents.md 实现了零集成代码的复合。Hub 上的开放权重模型库变成了一个可调用的多媒体原语库。代理优先选择已被文档化、可直接调用的 Space,而不是需要手动搭建的模型。集成壁垒基本消失:从“prompt 到旋转 3D 纪念碑”过去是一个项目,现在只是流水线的一步。

How an Agent Built a 3D Paris Gallery by Chaining Two Hugging Face Spaces

查看原文