Skill Distillation:让大模型当老师,小模型当学生
现在的大模型越来越贵,但很多任务其实不需要最强的模型来处理。这篇文章的核心痛点是:**怎么把大模型的能力迁移到本地小模型上,同时保持可维护性和可替换性**。
作者设计了一套三层架构。第一层是 QMD,一个本地的 markdown 知识库,存放大约 80 个工作流文件。第二层是 Skills,由原子级的 SKILL.md 文件组成,每个文件描述一个独立任务。第三层是 Agent Loop,运行 Plan → Tool Call → Observe → Refine 的循环,调用 17 个 Rust API 和若干 MCP 集成。关键创新在于「skill distillation」:用 Opus 4.7、GPT-5.1、Gemini 3 Pro 这些大模型来编写和优化技能文件,然后用 Qwen 35B 或 Gemma 26B 这些本地小模型来执行。大模型负责「教」,小模型负责「做」,中间介质是可直接阅读、版本控制、热替换的 markdown 文件。
这和传统方法有本质区别:知识蒸馏压缩的是软概率分布,指令微调把行为 bake 进权重,RAG 检索的是事实。而 skill distillation 检索的是「流程」——小模型不需要知道怎么评估一家公司,只需要知道按步骤执行就行了。这个框架的启发是:**模型本身变成了可插拔的执行器,真正有价值的是写在 markdown 里的流程知识**。作者甚至断言:「前沿模型变成老师,技能库变成公司知识,执行模型变成这个季度最便宜的模型」。


