Fyxer如何打造值得信赖的AI行政助理
Fyxer结合OpenAI模型与50万小时行政工作流,拆解邮件任务为30-50个专用模型,实现90天90%用户留存、53%草稿直接采纳率。
Fyxer如何打造值得信赖的AI行政助理
对许多职场人士来说,工作意味着在收件箱、会议、消息和应用之间追踪对话与承诺。缺乏可靠的上下文,这些承诺就可能被遗漏,进而损害项目和人际关系。Fyxer构建了一款AI行政助理,能够跟随工作在不同工具间的流转,将最新的OpenAI模型与超过50万小时的行政助理工作流相结合,把任务分配给数十个专用模型,并通过真实用户反馈持续改进。
邮件:最直观的试炼场
两封相同的邮件,可能因关系不同、历史不同、目标不同,需要完全不同的回复。这让看似简单的任务对AI来说异常困难。Fyxer联合创始人Archie Hollingsworth引用莫拉维克悖论解释:“人类觉得容易的事,计算机觉得难;计算机觉得容易的事,人类觉得难。”Fyxer的解法是学习每个用户的工作方式,像一位早已了解关键信息的助理那样回应。
OpenAI的前沿模型支持了从理解邮件、找到正确上下文到生成草稿的关键环节。Fyxer选择OpenAI,是因为其模型在内部基准测试中表现最佳,对语气和意图等主观任务有强大的微调能力,并通过白板会议和技术协作提供实操工程支持。
“我们选择OpenAI,因为他们有最好的模型,并给了我们真正的访问权限和紧密的合作关系。我可以在Slack里丢个问题,很快得到答案;遇到问题时,团队会来我们办公室一起解决。他们真的在场。” —— Archie Hollingsworth,Fyxer联合创始人
三条经验:构建高上下文AI产品
1. 把邮件拆成更小的任务
Fyxer围绕30-50个专用模型构建系统,每个模型只负责邮件工作流中很窄的一部分。它不是把邮件当作单一的文本生成任务,而是拆解成一系列预测:比如判断邮件是否需要回复、起草符合用户语气和上下文的回复。
Hollingsworth表示:“把问题拆成许多更小的模型,比让一个模型写好邮件要有效得多。”
新邮件到达时,一个回复决策模型会分类:这封邮件需要回复、需要安排日程,还是只需让用户知晓?如果需要回复,其他模型会分析邮件意图并预测互动的可能结果——对话是走向安排会议、解决请求,还是延续长期关系。
记忆是系统最重要的部分之一。Fyxer需要决定哪些细节应跨对话保留,哪些在一次交流后消失。新邮件到达时,检索模型会将其与存储的交互比较,并浮现与该联系人和线程最相关的记忆。
OpenAI模型驱动着Fyxer系统的多个步骤。“从消化邮件——理解它到底在说什么,到拉取并重新排序我们想包含的上下文,再到实际生成邮件,我们都使用OpenAI模型。”Shantsila说。
2. 基于优秀助理的真实工作方式训练
在推出AI产品之前,Fyxer积累了超过50万小时的行政助理工作流,这些真实数据成为训练和评估的基础。系统不是凭空猜测什么是好助理,而是学习人类助理如何处理语气、优先级和关系维护。
3. 用真实用户反馈持续改进
Fyxer的模型通过真实用户反馈不断优化。用户对AI生成草稿的接受、修改或拒绝,都成为信号,帮助系统更准确地理解个人偏好。
成果与启示
Fyxer公布的数据显示了这种方法的有效性:
- 90%:90天后的用户留存率
- 53%:AI生成草稿被原样接受的比例
对于构建高上下文AI产品的开发者,Fyxer的经验提供了可操作的思路:
- 不要用一个模型包打天下。将复杂任务拆解为多个专用模型,每个模型解决一个明确问题,整体效果更好。
- 记忆管理是关键。决定哪些信息跨对话保留、哪些丢弃,直接影响AI的上下文质量。
- 用真实工作流训练。积累领域专家的真实操作数据,比单纯依赖通用模型更能提升主观任务的表现。
- 建立反馈闭环。让用户行为成为持续改进的信号。
这些做法对AI使用者同样有参考价值:当你评估一个AI助理产品时,可以关注它是否理解你的个人语气、是否记住关键关系、是否把复杂任务拆解为可靠的小步骤。Fyxer的案例表明,值得信赖的AI助理不是靠一个万能模型,而是靠系统化的工程和对真实工作流的深刻理解。
本文基于 OpenAI Blog 的公开内容,由 AI 辅助整理改写后发布。
原标题:How Fyxer built an AI executive assistant people trust
阅读原文