用 Gradio Workflow 重建 AUTOMATIC1111

Gradio 团队发布了一个名为 Workflow1111 的示例项目,用单个 gr.Workflow 画布重建了 AUTOMATIC1111 的 stable-diffusion-webui 大部分功能。整个应用是一个包含 73 个节点的图,由 11 条媒体管线组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推提示词、检测生成 inpaint 掩码、ControlNet 风格预处理器、背景移除、PNG Info 存储与读取、图生视频。

所有管线都由四种操作符构建:fn(Python 函数)、model(通过 InferenceClient 调用的模型)、space(另一个 Gradio Space)、dataset(Hub 数据集行)。用户用 Hugging Face 账号或访问令牌登录后,模型调用消耗自己的配额。核心文生图管线包含提示词构建器、模型节点(通过 Inference Providers 调用 checkpoint),并在输出时把生成参数写入 PNG 元数据,供 PNG Info 管线读回。高清修复用 FLUX.1-Kontext 节点做二次去噪,图生图也复用同一节点。

项目展示了几个关键设计:提示词反推由 Qwen2.5-VL VLM 完成,同时并行跑一个 ViT 分类器(示例给出标签置信度:restaurant 51.9%、tobacco shop 15.6%、toyshop 9.1%),由于两个节点共享同一图像输入,gr.Workflow 自动并行执行。DETR 检测器生成对象框,再用 Pillow/NumPy 本地绘制框和生成掩码。提示词矩阵用 fn 节点生成四个变体,四个文生图节点并列执行,最后拼成联系表。上采样和背景移除调用 Space 节点(AuraSR ×4、BRIA RMBG-2.0),而 Canny、line art 等注释器全部是纯 NumPy 写的 fn 节点,无模型,CPU 上半秒左右处理一张示例图。

全文强调大多数节点不需要网络调用:36 个操作符节点中 32 个是 fn,其中 22 个完全进程内运行,约三分之二的画布在断网时仍能工作。所有模型调用默认走远程硬件,因此构建和运行 Workflow1111 不需要自备 GPU。但 fn 节点也可以加载本地模型,项目提到 FastVideo/fastvideo-fasth3-preview 这个 gr.Workflow 应用,用 @spaces.GPU 装饰器在 ZeroGPU 上运行 FastH3 生成带音轨的视频,Workflow1111 画布同样能驱动本地 GPU。

每个输出节点自动成为 REST 端点,Workflow1111 暴露了九个(/image、/edited_image、/generated_prompt 等),无需手写路由。同一端点也可作为 MCP 工具暴露,启动时设 mcp_server=True,AI 客户端(Claude Code、Cursor)可通过 MCP 协议调用,每个调用者用自己的 token,Space 不保存密钥。项目定位是比肩 ComfyUI 的节点图工具,但更强调硬件可归属他人、端点自动生成、OAuth 身份复用、多模态混合。

作者给出的起点非常简单:一个 bind 函数加 launch() 就能打开画布,gradio deploy 部署到 Space。用户可 Duplicate Workflow1111 后重接线,或参考之前的五个小示例。

Rebuilding AUTOMATIC1111 with Gradio Workflow

查看原文