
OpenAI 打造全能 Agent:ChatGPT Work 能接管你的数字生活吗?

OpenAI 上个月发布了 ChatGPT Work,一个面向白领工作者的 AI Agent 产品,订阅费每月 20 美元,位于最低档。它的前身是 Codex 编码工具,现在被改造成让非工程师也能让 AI 自主完成多步骤任务。OpenAI 桌面应用负责人 Andrew Ambrosino 表示,他自己已经把收件箱、Slack、Notion、Figma 等全部交给了这款应用,理由是“只有这样才能测试未来”。他说:“如果让 AI 写文档,它会不会从私人 DM 中提取信息而不自知?有可能。但我为了这份工作会承担个人风险,而至今还没出过事。”
产品设计上,ChatGPT Work 本质上是给 LLM 包了一层“harness”——工程上指包裹在模型外的软件层,决定模型能看到哪些信息、能用哪些工具、如何反馈结果。对开发者来说,命令行界面就足以改变编码方式,但大多数人不碰 CLI。Ambrosino 说,Agent 产品要处理的是“你生活中混乱的、1995 年建的网站、从未更新的工具”。为了让普通用户上手,产品加了许多按钮,尽管内部有人觉得没必要,但他反驳:“可发现性在这个阶段很重要,总有一天我们会去掉按钮。”他类比拟物化设计(比如计算器 App 做得像实体计算器),认为那不只是丑设计,而是帮助人们过渡。
OpenAI 内部使用数据与现实脱节。一项由 OpenAI 支持的研究显示,2025 年 6 月,OpenAI 内部 98% 员工使用 Codex,但组织级订阅者只有 17% 使用,个人订阅者不到 1%。这种落差既是挑战也是机会。核心产品负责人 Thibault Sottiaux 说,ChatGPT Work 能自主完成复杂任务,而且“令人愉悦且安全”,这是 OpenAI 的使命——“让每个人都参与进来”。商业上,Agent 工作时长更长、消耗 token 更多,每位用户创造的收入潜力更高。
垂直领域的竞争对手在抢客户。像面向法律的 Harvey、面向销售的 Clay 都不绑定单一模型,而是接入当时最好的模型。a16z 的 Christian Catalini 在博客中写道:“如果实验室不能迅速掌握规模化 AI 所需的关键互补资产,价值就会流向他处。”这被行业分析师视为 OpenAI 及其竞争对手的主要挑战之一。
作者亲测了 ChatGPT Work。他让 AI 从邮件中提取儿子幼儿园的日程并加入 Google 日历,确实成功了。他也让 AI 分析上市公司财务,生成了自动更新的仪表盘;还做了太空发射的可查询数据库。但配置权限的过程令人困惑:多次试图只给“读”权限却报错,最后在移动端弹窗提示必须完全访问才能工作。很多设置只在网页端,导致作者频繁切换。它连 Google 日历可以创建事件,但不能创建新日历。作者提醒,如果“努力程度”设置不高,结果就像最差的实习生——早期采用者常警告新手别轻易放弃。
工程负责人 Joe Gershenson 承认,努力程度设置对新用户还不直观,“有些地方我们还能做得更好”。另一个难点:多数工作流不像代码那样可量化、可评估。软件要么能运行要么崩,但“一份好演示、好战略、好销售话术”很难衡量。OpenAI 说他们用基准 GDPval,覆盖 44 种职业和数百个知识工作测试,另外结合用户反馈。但非正式答案来自员工自身,Ambrosino 承认需要不断分辨:“我们做的流程是别人也会做的,还是我们很奇怪?”
OpenAI 与 Anthropic 的竞争贯穿产品设计。工程师们不愿承认参考 Claude Cowork,但作者指出两家界面极度相似,而且 ChatGPT Work 首次启动就提示迁移 Claude Cowork 数据。回顾历史:OpenAI 最初把 Codex 做成网页应用,押注模型足够聪明能自主处理任务,结果“有点 AGI 上头”。而很晚推出的 Claude Code 围绕来回对话设计,先给几个方案让用户选,再逐步推进、不断确认,事实证明更有效。OpenAI 后来补上了交互环节。下载统计显示,直到今年 4 月 Claude Code 一直更受欢迎,但此后 Codex 稍微领先;企业端调查也显示 OpenAI 在追赶。
关于 harness 的本质,OpenAI 相信“bitter lesson”——通用模型的进步比领域经验更重要。Gershenson 说:“短期加一堆 if-then 和工具能有好结果,但下个模型几个月内就会让它们过时。”团队目标是用最简单的方式把模型需要的工具和上下文暴露给模型,其余交给模型自己。但他的观点受到挑战:Databricks 的测试发现,开源 harness(名为 Pi,由 Earendil 发布)在同样使用 GPT 5.5 模型时表现超过 Codex。Pi 被用来构建 OpenClaw 和 Cloudflare OS。Pi 作者 Mario Zechner 认为,大模型实验室推行自己的 harness 是为了锁定用户,“他们必须拥有整个技术栈,否则只是模型提供商,就得和中国模型竞争。”
成本问题也开始暴露。作者在 20 美元订阅下,四天用了超过 8000 万 token,按模型分析价值约 65 美元——足足是订阅费的 3 倍。OpenAI 承认在推效率,Sottiaux 提到 Luna 模型近期降价 80%。他说:“六个月后,同样的任务应该花更少的钱。”同时,配置所有插件和权限的痛苦,本身也构成一种锁定效应。


