行业公司

模拟部署:发布前预测模型在真实环境中的行为

OpenAI 提出一种新方法,用真实用户历史对话替换模型回答来模拟新模型上线后的真实表现。测试下来中位数预测误差仅1.5倍,还能抓到传统评估漏掉的“计算器作弊”这类奖励黑客行为。难点在于工具环境模拟的保真度,但方向值得所有做AI安全的人关注。

阅读详情模拟部署:发布前预测模型在真实环境中的行为