Fyxer 如何构建令人信任的 AI 行政助理

Fyxer 是一家做 AI 行政助理的公司。产品定位很简单:跟着工作流走,跨邮箱、会议、消息和应用追踪对话与承诺。原始驱动力来自创始团队自营多年的真人助理服务——在推出 AI 产品之前,Fyxer 已经积累了超过 50 万小时标注过的助理工作流数据。这些数据后来成了训练系统的核心资产。

难点在哪?同一封邮件,不同的人需要的回复完全不同。回复取决于双方关系、历史往来、以及各自想达成的目标。Fyxer 联合创始人 Archie Hollingsworth 引用 Moravec 悖论来解释:人类觉得容易的事,对计算机很难。处理这种复杂度的办法,是学习每个用户的工作方式,像一位已经知道什么重要的助理那样去回复。

模型选型上,Fyxer 选了 OpenAI。原因是其模型在内部 benchmark 上表现最好,微调能力适合语气和意图这类主观任务,而且工程支持到位——可以白板沟通,出了问题团队会到现场。联合创始人的原话是:把问题丢到 Slack 很快有答复,“They show up.”

Fyxer 的方法总结为三条经验。

第一条,把邮件拆成小任务。系统围绕 30-50 个专用模型构建,每个模型只负责邮件工作流的一小段。新邮件到达时,回复决策模型先分类:需要回复、需要安排日程、还是只需要用户知道。需要回复时,更多模型分析意图、预测交互走向。记忆是系统最重的部分之一:哪些细节要跨对话保留,哪些用完即弃,由检索模型对比历史交互后决定,把与当前人和话题最相关的记忆抽出来。OpenAI 模型贯穿全过程:消化邮件、拉取并重排上下文、最终生成邮件。

第二条,用真实助理的工作方式训练。那 50 万小时数据来自工作本身,记录了好的回复背后的小判断:何时该快回、何时该等,哪段旧对话重要,同一请求对不同人如何给不同响应。Fyxer 用监督微调和 LoRA 创建任务专用变体,控制训练成本。早期用 OpenAI 的微调平台做高精度任务,最近和 OpenAI 托管微调团队合作,把新 checkpoint 推上生产。部署前,模型要在自建验证集上评估,覆盖起草、分类、优先级排序;同时权衡准确率、响应时间和成本。

第三条,把用户反馈变成自训练循环。用户编辑草稿后,原稿和终稿的差异就是偏好信号。Fyxer 用 DPO 把这些对比转成训练数据,不必人工标注。每个编辑改动都要过 A/B 测试,只有达到统计显著改进才上线。凭借用户量,有时一天内就能达到显著阈值。

结果:目前 53% 的 AI 草稿被原样采纳。2025 年 ARR 从 100 万美元涨到 3200 万美元。Hollingsworth 强调留存比 ARR 更硬:超过 90% 的用户在 90 天节点仍在付费并使用

下一步是构建对关系、偏好和进行中工作线程的更丰富理解,从起草回复走向更广的 AI 助理,接管更多沟通与协调工作。愿景是让用户不用打开电脑,也能信任 Fyxer 管理一切。

How Fyxer built an AI executive assistant people trust

查看原文