智能工具库

全栈自研Harness:通用Agent公司的技术赌注

全栈自研Harness:通用Agent公司的技术赌注

Floatboat 自研 Runtime 和 Harness,用 DeepSeek-V4-Flash 在五项基准上超越更贵的 Claude Opus 4.8,长程任务增益达 23.6%,揭示系统工程的增量价值。

2026-08-31 0来源:InfoQ 中文

背景:模型之外的另一半系统

2026 年 8 月,Floatboat 公布的一组评测数据引发关注:使用 DeepSeek-V4-Flash(混合价 $0.175/M)运行五项基准,成绩全面超越贵 57.1 倍的 Claude Opus 4.8。更关键的是,同一个模型在 DeepSeek 官方 Harness 上一项未赢,接入 Floatboat Harness 后五项全胜。增益随任务程长递增:短程任务仅 1.9%,长程 DeepSWE 达 23.6%。这组数据首次为“模型之外那半个系统”提供了定量答案——Harness 的工程设计可以显著改变模型的实际表现。

Floatboat 的设计哲学:Agent 不是必需品

Floatboat 团队的底色来自十年安卓 OS 生态的产品与商业化经验,服务过数亿用户。他们选择做桌面客户端,而非网页对话框,因为真实工作流是跨文件、跨应用、跨权限、持续数小时甚至数天的长程任务。Web 端 Agent 只能感知上传的文件和 prompt,无法触及文件结构、操作历史等隐性知识。

团队自研了完整的 Runtime、Agent Loop、Tools 和 Infra,以及自适应进化系统 FloatSail。核心设计原则是:不要求所有任务都经过 Agent。产品技术负责人 Remy 表示:“如果一件事用 Workflow 或普通桌面操作就能完成,根本不需要 Agent。只有真正出现不确定性时,Agent 才介入。”这既是产品判断,也是经济判断——不让模型做不需要做的事,成本可控是设计出来的,而非优化出来的。

长程任务的挑战与 Harness 的增益

行业多数 Harness 为短程问答优化,但真实工作往往是长程的:交付标准开始时模糊,模型在长链条中会持续漂移。Floatboat 的 Harness 不是为了“让模型多跑几步”,而是为了在每一步把结果拉回交付标准——该回退时回退,该追问时追问,该自我校验时自我校验。评测数据印证了逻辑:HLR(Harness Leverage Ratio)从短程的 0.78 倍涨到长程的 3.57 倍,任务越复杂,换 Harness 比换模型更划算。

技术选择:GUI-Agent 双向协议与 Human-Centric 设计

Floatboat 的技术架构有几个独特选择:

  • 跨平台架构:支持多种操作系统,便于用户在不同设备间无缝切换。
  • 产品与技术同构:UI 不是 Harness 的包装,而是人和 Agent 共享的 Runtime。GUI-Agent 双向协议意味着用户能看到的 GUI,Agent 也能理解和修改。用户可以先在 UI 完成部分操作,再口述委托给 Agent,控制权自然交接。
  • 混合路径:Floatboat 允许代码、Workflow、Agent 和 LLM 协同,根据任务自适应选择最优路径,而不是强制 Agent 参与所有任务。

模型是否到顶?Harness 的补偿与局限

Remy 认为,模型在上限上远未到顶,但下限已很高。日常编程任务差距缩小,但在陌生代码库、开放任务、跨工具协作和长时状态保持上仍有差异。Floatboat 的目标不是替模型兜底,而是最大化模型能力。模型变强后,Harness 的机械纠错会变轻,但 Harness 无法补足模型缺乏的抽象推理、领域知识和概念跃迁。模型决定每一步判断的上限,Harness 决定这些判断能否在长路径上积累成结果

架构收敛?差异在于整体配合

尽管各 Harness 的模块清单相似(Context、Tools、Loop、Verifier、Runtime),但 Remy 强调系统远未收敛。真正形成差异的是整体配合:能否围绕交付标准稳定收敛,以及系统能否被 Agent 驱动进化。未来评估 Harness 应看三个结果:任务收敛速度、错误局部化能力、每成功结果的成本。架构图会趋同,但运行时的因果纪律、反馈密度和产品判断不会自动趋同。

对开发者和 AI 使用者的启示

  • 评估 Harness 时,不要只看模块数量,要关注长程任务的实际增益和成本效率。
  • 设计 Agent 系统时,考虑混合路径,让简单任务走 Workflow,复杂任务才交给 Agent,以控制成本。
  • 理解模型与系统边界:模型提供智能上限,Harness 负责将智能转化为稳定交付,两者需协同优化。

本文基于 InfoQ 中文 的公开内容,由 AI 辅助整理改写后发布。

原标题:自研Runtime、Agent Loop、Infra:一家通用Agent公司的全栈赌注

阅读原文