加速基础模型升级的教训

升级基础模型,比如从Gemini旧版迁移到3.5,通常需要几个月的手动测试和验证。工程团队要逐条评估新模型的输出,确保质量,这个过程极其缓慢且成本高昂。而模型迭代速度又越来越快,这导致很多团队根本跟不上前沿,积累了大量基础设施技术债务。Google Cloud Applied ML团队发现,传统的自动化流程过于僵化,无法处理不同数据格式和边缘情况,最终他们转向了更灵活的agent架构。

他们的核心解法是构建一个agentic workflow,将模型迁移视为一个自动化的、自适应的循环。具体来说,他们用基于模型的评估器(Autoraters)替代人工审查,大规模快速评估新checkpoint的质量。然后利用Gemini Enterprise Agent Platform中的Agent Development Kit搭建一个agent循环,这个agent能根据具体项目需求动态分析数据、测试提示词。最后,用Antigravity来编排整个流程,自动化底层的编码和agent协调,并加入损失报告等特性。最终,把迁移时间从数月缩短到了数小时

这件事给我的启发是:不要用僵化的自动化去硬套复杂任务,把模型升级看成是一个agentic workflow。这意味着你需要一个能适应变化的系统,而不是一个固定的脚本。这种思路能大幅减少基础设施技术债务,让团队自信地跟上AI前沿。另外,用模型来评估模型(Autoraters)是加速的关键,它把人工瓶颈变成了可扩展的自动化环节。对于所有被模型升级折磨的团队,这套方法论值得借鉴。

Lessons in accelerating foundation model upgrades

查看原文