KDDI如何用Agent Development Kit优化RAG性能

日本电信运营商KDDI开发了一款面向消费者的RAG应用Buffmee,主打“AI陪你成长”。它基于超过100种来源(书籍、杂志、Web媒体)做搜索、摘要和个人化探索。上线时,工程团队面临两个问题:响应延迟达不到目标;海量版权内容要求答案不得凭空编造。为了同时兼顾质量和速度,他们需要一套系统的评估和实时瓶颈定位方法。

改进后的结果很直接:KDDI将总应用响应延迟降低38%,达成目标;首次令牌生成时间(TTFT)改善近18%。KDDI AI产品部门的Shunya Onoda说,他们的愿景是内容一旦导入,就能立刻作为可运行的RAG系统工作,Google的细致指导让这成为现实。这些改进让Buffmee能以严格信任和合规要求向用户提供互动问答和深入分析。

评估环节是基础。传统人工测试难以应对大型内容库。团队用Gemini Enterprise Agent Platform Evaluation Service设计了自动化评估流程,引入LLM-as-a-Judge和“Rule of Hundreds”框架,用数据驱动取代手工测试。他们导入文档语料,构建数百个自动化测试,为每个用例建立基准数据集。结果,答案的groundedness(可信度/扎根于事实的程度)分数提升25%。

性能优化聚焦在生产日志。团队使用BigQuery Agent Analytics和Agent Development Kit(ADK)日志分析agent,分析真实流量。他们发现技能划分方式和提示词膨胀——尤其是复杂、多页的系统提示词——会显著影响TTFT。通过优化系统提示词、把技能内联整合、调整子代理路由,他们定位并解决了深堆栈瓶颈,且没有牺牲回答准确性。

团队将经验收敛为四条可复用的评估实践。一是改用二元评判:把关键的1–5分制改成“通过(1)/不通过(0)”的二元判断,降低方差和噪声,提高了自动化评判的准确度。二是战略性内容采样:不评估每篇文档,而是把语料按文件格式(Web文章、EPUB、PDF、结构化数据)和媒介构成(文字为主、图片为主、混合)做二维分类,从每个格子中选代表样本,评估工作量减少75%,同时保持测试覆盖。三是用产品判断校准阈值:产品负责人把随机抽样的答案和自动评分放在一起看,人工确定“达到可上线质量”的真实标准,而不是依赖默认参数。四是将超长提示词模块化:超过800行的系统提示词会导致LLM注意力漂移和延迟,团队按功能把提示词拆成ADK Skills,动态只加载所需逻辑。

想把这些方法用到自己的应用,原文给出了三条行动建议:用Gen AI评估服务系统化测量质量;用Agent Development Kit组织agent,并刻意采用渐进式披露(progressive disclosure);用Agent Search做grounding,并检查检索查询。

How KDDI Optimized RAG Performance with Agent Development Kit

查看原文