Holo3.1:快速本地推理的电脑使用 Agent 模型

Holo3.1 是 Holo3 的升级版,核心解决的是「电脑使用 AI 模型在生产环境中跨场景部署困难」这个实际问题——之前强模型往往只能在单一环境(浏览器或桌面)中表现好,但实际用户的业务流程横跨 web、桌面、移动端,还有各种不同的 agent 框架,迁移成本极高。

解法上,他们做了三件事:第一,大幅提升移动端自动化能力,35B-A3B 在 AndroidWorld 上从 67% 跃升至 79.3%;第二,引入原生 function-calling 协议支持,让模型能无缝接入第三方 agent 框架,跨框架性能差距从显著缩小到近乎持平;第三,也是最硬核的部分——首次在电脑使用模型上释放量化权重,涵盖 FP8、Q4 GGUF 和 NVFP4 三种格式,其中 NVFP4 W4A16 配置在 DGX Spark 上实现了 1.74 倍吞吐量提升,端到端平均步进时间从 6.8 秒压缩到 3.3 秒,终于让本地推理达到了可用的响应速度。

我的判断是:量化电脑使用模型这件事意义被低估了。目前行业大多只关注云端推理的性能上限,但真正的隐私敏感场景(企业内部系统、医疗数据)和边缘设备场景,本地执行才是刚需。Holo3.1 把量化精度、硬件适配、端到端性能优化打包在一起发布,意味着「本地运行的电脑使用 agent」从技术可行变成了工程就绪。这条路走下去,未来用户完全可以在自己的 MacBook 上跑一个私有化的 AI 助手操作自己的桌面应用,数据不出本地网络,而这在六个月前还只是概念。

Holo3.1: Fast & Local Computer Use Agents

查看原文