用工具修复层让开源模型超越闭源

视频亮点

04:48

开源模型在工具调用上的弱点大多是 harness 问题,而非能力不足

16:23

通过修复层,DeepSeek V4 Pro 在 6/10 项评估中超越 Opus 4.7

12:04

用 validate-then-repair 替代 rigid validation 可大幅提升可靠性

**Ahmad Awais**(CommandCodeAI 的 CEO)在访谈中分享了他们如何让开源模型 **DeepSeek V4 Pro** 在工具调用上超越 **Opus 4.7**。核心是一个轻量级的“工具输入修复层”,通过分析数十亿 token 的失败模式,将传统严格校验改为“先校验再修复”策略,针对性地解决开源模型在 Agent 任务中的工具混淆问题。

Awais 反对“开源模型能力不足”的普遍看法,认为所谓的弱点大多是 **harness/contract 问题**,而非模型本身能力差距。他主张用 targeted repairs、语义提示和透明反馈来修复,而不是更换底层 LLM。同时,他批评现有 Agent 框架对开源模型支持粗糙,导致性能被低估。

这个“验证再修复”思路可能改变 Agent 开发范式:**无需昂贵模型也能达到顶尖效果**。Awais 团队已开源 CommandCode 的部分实现,未来更多模型可通过类似修复层直接受益,尤其对预算有限的开发团队具有实际价值。

⚡️Making DeepSeek v4 outperform Opus 4.7 with Taste — @AhmadAwais , CommandCode.ai

查看原文