
一个Agent如何仅靠链式调用两个Hugging Face Space搭建出3D巴黎画廊

这篇文章解决了一个非常现实的问题:做多模态AI应用,大部分时间都花在了集成上——装SDK、配GPU、调输入格式,而不是真正做产品。作者想做一个3D巴黎景点展示网站,自己没写一行生成代码,没部署一个模型,全靠一个coding agent把两个Hugging Face Space串起来就搞定了。这种集成成本才是阻碍AI应用落地的真正痛点。
核心解法极其聪明,简单说就是每个Gradio Space都内置了一个plain-text的**agents.md**文件。这个文件就是一个标准化接口说明书,告诉agent怎么调用:API端点在哪、参数怎么传、文件怎么上传、怎么轮询结果。agent读了这个文件就能直接驱动整个Space,不需要装任何客户端库。更妙的是可以链式调用——**一个Space的输出直接喂给下一个Space**。这个例子里agent先调图像生成Space出图,再调3D重建Space把单张图变成高斯泼溅,全程零集成代码。
我的判断是,这很可能是未来多媒体软件的标准构建方式。**模型变成可组合的积木块**,而agents.md就是让这些积木块能被agent发现和使用的钥匙。在这个架构下,做一个新应用的成本降低到了描述它的成本——你只需要跟agent说“做一个日本景点的3D画廊”,它就会自己去调Space链、做压缩、搭Three.js预览器。集成不再是瓶颈,定义产出的品味和想法才是。


