
智能体AI时代的科学计算

科学计算是学术和工业研究的核心支柱,但分析软件却常因工程经验不足、维护困难而拖慢研究进度。许多工具起源于论文附带代码,由小团队构建,缺乏长期支持和优化。
AI agent正在改变这一局面。OpenAI 发布的这份探索性领域报告,汇集了8个 agent 辅助的科学计算项目(5个使用 Codex,3个使用 Codex 与 Claude Code 的组合),主要集中在生命科学领域。贡献者报告称,agent 显著加速了软件开发和维护,有时甚至让小型团队完成原本需要大量时间或专业工程支持的工作。
报告案例包括现代化基因组数据解析库 cyvcf2,通过 GPT‑5.5 替换了其遗留构建和打包系统;以及 MHCflurry 等项目的迁移与优化。在所有这些项目中,研究者的角色从实现转变为验证与编排:规定要构建什么、定义如何度量正确性、判断项目何时准备就绪。
尽管范围各异,项目显示出共同主题:agent 擅长处理具体、边界清晰的任务,但无法可靠地判断自身输出是否科学有效——它们常在包含明显错误时仍表现出自信。最有效的验证方法是使用外部参考或可衡量的接受目标,如精确输出一致、与现有工具结果匹配、正确的统计行为或基于模拟数据预先确定的答案。
项目通常以反馈驱动迭代方式推进,而非一次性完成。agent 能快速生成初始实现,但处理边缘情况和细微数值差异耗时更长,完成最后阶段往往耗费最多精力。
长期维护仍然是关键挑战。降低实现成本也容易导致大量相似重写,分散用户和专家注意力。成熟的科学软件包含未文档化的约定、兼容要求和用户信任,仅翻译源代码无法复现。案例展示了不同出路:对 MHCflurry 和 cyvcf2 的改动被纳入上游项目;rustar-aligner 则因原项目被废弃而交由新社区维护。
报告指出,agent 如 Codex 能显著降低维护、迁移、优化和新实现的成本,但其长期科学价值仍取决于人类对构建什么、如何验证以及谁来维护的决策。更深层的变化不是研究者能生产更多软件,而是能将更多精力集中在定义、验证和托管工具上。


