ITBench-AA:前沿模型在企业IT运维任务基准测试中得分均低于50%
当前前沿模型在真实企业IT运维任务中表现不佳——所有模型得分都低于50%,这说明它们还没有准备好投入生产环境的运维工作。ITBench-AA由Artificial Analysis与IBM Research联合开发,专注于Site Reliability Engineering场景,要求模型通过shell命令分析Kubernetes事故快照(包含告警、事件追踪、日志等),识别故障根因。核心发现是:更多的调查轮次并不带来更好的准确率。GPT-5.5平均31轮得46%,而Gemini 3.1 Pro Preview平均83轮仅得30%——模型过度调查反而会提交上游故障注入机制或并发症状作为根因,被评分机制的召回门控精确率惩罚。开权重模型在成本前沿表现出色:Gemma 4 31B以$0.14/任务得分37%,在分数和成本上均超过Gemini 3.1 Pro Preview($2.23/任务,30%)。GLM-5.1以$1.23/任务得分40%,与Gemini 3.5 Flash得分相当但成本更低。方法论上使用开源Stirrup评估框架,59个任务各重复3次,采用全召回下的平均精确率评分,确保识别全部根因实体才能得满分。
Claude Opus 4.7领先榜单47%,但成本高达$5.38/任务,是最昂贵的选择。评测覆盖Kubernetes部署、服务、Pod等实体的根因识别,涵盖资源配额耗尽、滚动发布失败、连接池耗尽、网络分区等典型SRE故障模式。公开19个全新留出任务以防止数据污染。
这项基准测试揭示了当前Agent能力的一个关键瓶颈:诊断性推理能力不足。事故调查不是越深入越好,过度调查反而引入误报。开源模型在成本效益上展现出竞争力,为资源受限场景提供了可行选择。


