开源模型生态:2026年夏季观察

Hugging Face 发布 2026 年夏季开源模型生态观察报告,基于 1 月至 8 月 Hub 上的实际数据。报告指出,尽管模型发布数量持续增长(仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万),但分布极度集中:85.6% 的模型累计下载量不足 200 次1.5% 的仓库贡献了 99.2% 的下载量

前沿模型进展加速,但地理格局已变。中国实验室跳过小模型直接发布超大模型,每月最大规模在 754B 到 2.78T 参数之间,而美国实验室七个月中有五个月自身最大模型低于 130B(例外是 NVIDIA 的 Nemotron 3 Ultra 561B 和 Thinking Machines Lab 的 Inkling 952B)。美国开源主力变成了硬件公司:AMD 和 NVIDIA 各发布 200+ 新模型,远超其他机构。美国前沿 (>100B) 的原创模型很少,多数基于中国模型做二次构建。中国模型则越来越多地针对国产芯片优化。

“注意力 ≠ 采用”是报告核心发现之一。按 2026 年累计下载量排名的 Top 25 和按喜欢数排名的 Top 25 模型,只有一个重叠。2026 年发布的新模型无一进入下载 Top 25,而 Top 25 中有 13 个来自 2022 年。例如 all-MiniLM-L6-v2 七个月被下载 15.5 亿次,但只有 5,156 个喜欢;Kimi-K3 每次喜欢对应约 60 次下载。喜欢代表前沿兴奋点,下载代表实际基础设施依赖。中国前沿实验室的下载集中在 70B 以上模型,而美国大厂的下载几乎全在 70B 以下。Moonshot 仅有 3,700 万次下载,而 Qwen 达到 20.45 亿次,相差约 55 倍。

开源权重许可远比想象中宽松。2026 年中国超过 20B 参数的 178 个模型中,59% 使用 Apache 2.0,22% 使用 MIT,没有任何一个使用非商业限制。DeepSeek 和 Z.ai 将 700B 到 1.65T 的模型以纯 MIT 发布。美国同规模下仅 29% 为 Apache/MIT,41% 为自定义条款。显然,这些实验室并不靠卖许可赚钱,而是通过 API、云业务、硬件生态或社区估值变现。

Qwen 已成为社区默认的基础模型。其衍生模型数量达 151,448 个,是 Meta 的 2.6 倍,Llama 的 4.7 倍,Google 为 82,506 个。Qwen 衍生每天新增 180–210 个,原因包括:一致性(持续发布)、覆盖度(从 1B 以下到 2.4T)、开放性(Apache 2.0)。值得注意的是,31,245 个 GGUF 转换中,Qwen 官方只发布了 54 个,其余由社区完成。

小模型仍是实际部署主力。参数小于 1B 的模型占所有历史下载量的 83%,大于 100B 的仅占 1%。2026 年数据同样:超过 70B 的模型仅占 3%。但 llama.cpp 使大模型本地运行成为可能:7 月其 GGUF 构建已支持 284B 的 DeepSeek-V4-Flash 和约 2.8T 的 Kimi-K3。GGUF 下载量 Qwen 每月 3,960 万次,远超 Gemma 的 2,080 万和 Llama 的 750 万。模型仓库增长 21.5%,但 gguf 库增长 464%,lerobot 194%,mlx 148%,而 transformers 仅 16%。基础设施层增长远快于建模核心。

Agent 首次成为 Hub 的第一大用户。2026 年 7 月新增的 agent-usage 数据集显示,Claude Code 占 44.4%,但 4 月曾占 67.8%,5 月骤降至 6.4%;Codex 从 10.4% 稳步升至 20.8%。近 1/4 流量来自未注册的客户端,新工具涌现速度超过任何注册表。Hugging Face 已为此做了适配:机器可读 Markdown、agent traces、agents.md 端点、MCP 服务器等。7 月还发生了首个自主 Agent 持续入侵事件,最终用量化开源的 GLM-5.2 完成分析。

展望:地理再平衡加速,但 AI 竞争是马拉松。一个覆盖广泛、被社区采纳的模型家族(如 Qwen)能形成正向循环,最终可能带来商业回报。下一次报告可能因 Agent 成为主要使用者而完全不同。

State of Open Models: Summer 2026 Observations

查看原文