智能工具库

GPT-5.6 实战指南:低成本构建高性能智能体

OpenAI 发布 GPT-5.6 开发者指南,聚焦降低智能体构建成本。通过模型分级选择、推理强度调节及 Responses API 新特性(保留推理、多智能体编排、程序化工具调用),初创公司可用更低成本实现更优性能,并附有多个真实生产案例。

2026-08-13 0来源:OpenAI Blog

开篇:智能体构建的经济学正在被重写

2026 年 8 月,OpenAI 发布了面向开发者的 GPT-5.6 构建指南。这份指南并非简单的模型介绍,而是基于多家初创公司从早期测试到生产环境的实战经验总结。核心观点非常明确:构建前沿级智能体的成本门槛,已经被 GPT-5.6 大幅拉低。对于正在为推理成本苦恼的团队来说,这可能是今年最值得关注的技术趋势之一。

核心变化:用更少的 Token 做更多的事

开箱即用的性价比飞跃

从 GPT-5 开始,OpenAI 每一代模型都在追求用更少的 Token 处理更长周期的任务,GPT-5.6 将这一趋势推向了新高度。最直观的证据来自基准测试:在 Agents' Last Exam 中,使用低推理强度的 GPT-5.6 Sol 模型,性能竟然超过了使用高推理强度的 GPT-5.5。这意味着,很多原本需要顶级配置的任务,现在用更低的成本就能完成。

Hex 公司的 AI 研究负责人 Izzy Miller 分享道:"我们将 GPT-5.6 直接接入现有框架,采用低推理强度后取得了最佳结果。它知道何时没有数据,不会追逐错误线索,用更少的 Token 就能得出正确答案。" 这种"知道自己不知道什么"的能力,正是降低无效推理消耗的关键。

模型选择策略:小模型也能扛大梁

过去,长耗时任务几乎必须使用最高推理强度的旗舰模型。而 GPT-5.6 系列中的 Luna 和 Terra 模型,通过增加测试时计算,正在改变这一局面。

几个来自真实生产环境的案例很有说服力:

  • Hypha:Luna 以 1/18 的成本保留了 GPT-5.5 98% 的文档提取准确率。
  • Browser Use:Luna 处理 106 项复杂浏览器任务,以 14 美元成本完成 78%,而当前 SOTA 模型完成 80% 需要约 235 美元。
  • PlayerZero:在代码探索任务中,Luna 将推理成本降低 64%,响应时间缩短 90%,F1 得分反而提高了 5 个百分点。

更直观的对比来自 BrowseComp 基准测试:三个月前,GPT-5.5(极高推理)得分 84.36%,成本 33.27 美元;如今 GPT-5.6 Luna(极高推理)得分 84.04%,成本仅 1.33 美元。性能几乎持平,成本降了 25 倍

对于高负载、延迟敏感或重复性步骤,小型模型的优势尤其明显。例如法律科技公司可以先让 Terra 或 Luna 解析手写备忘录,再交由更强大的模型分析,不必为整个流程支付前沿模型的费用。

Responses API 三大新特性:架构效率的乘法器

GPT-5.6 的性能提升不仅靠模型本身,还来自 Responses API 的三项架构改进,它们可以组合使用,效果惊人。

1. 保留推理与原生压缩:让长任务不"断片"

在多轮交互间保留推理状态,并用原生压缩精简长对话,模型在长耗时任务中不会思路混乱或重建上下文。在 ARC-AGI-3 基准测试中,GPT-5.6 Sol 启用这两项功能后,得分从 13.3% 跃升至 38.3%,而输出 Token 用量降至约六分之一。模型没变,性能提升近三倍,纯粹是架构优化的功劳。

2. 程序化工具调用:把确定性工作交给代码

智能体工作流通常混合两类任务:需要判断的任务和移动、筛选数据的任务。当模型检索 100 份申报文件并筛选交易时,不应在上下文窗口里逐一推理所有中间结果。程序化工具调用允许模型编写 JavaScript 来编排工具、并行执行调用、在上下文窗口外处理输出,让模型专注于真正的判断工作。

金融 AI 公司 Rogo 的应用 AI 团队反馈,使用该功能后,在达到质量要求的同时减少了 21% 的输入 Token。这正体现了"能讨论研究的智能体"与"能执行研究的智能体"的本质区别。

3. 原生多智能体编排:并行拆解复杂任务

对于可并行处理的任务,主智能体可以编排多个子智能体并行工作,最后汇总输出。Quadrillion 创始人 E Chi 表示,GPT-5.6 Sol 的完成速度几乎快过他们测试的所有模型;Obvious 则一次性提交六份规格说明,让模型同时撰写、构建并讲解,质量毫不下降。多智能体行为仍可通过提示引导,比如告诉模型何时启动子智能体,能避免不必要的 Token 开销。

提示词缓存:细节里的降本增效

GPT-5.6 系列的提示词缓存 TTL 已延长至至少 30 分钟,且支持在上下文窗口内设置确定性缓存断点。Ploy 公司的工程师通过设置缓存断点和工作空间专用键,将未缓存的输入减少了 28%。配合合适的 prompt_cache_key,还能提高请求命中缓存引擎的概率,进一步降低延迟。

结语:给开发者的行动建议

这份指南传递的核心信息很清晰:构建智能体的经济性已经发生根本性变化。过去每一步都需要前沿模型的用例,如今通过选择合适的小模型、调整推理强度、利用新 API 特性,只需很少一部分成本就能取得相当甚至更好的结果。建议开发者在落地时:先评估任务是否必须用旗舰模型;尝试降低推理强度观察效果;善用程序化工具调用和多智能体编排;最后别忘了配置提示词缓存。

指南由 Samarth Madduru、Prashant Mital、Dave Leo 和 Julien Reiman 基于与多家初创公司的合作经验编写,内容务实,值得开发者仔细研读。

本文基于 OpenAI Blog 的公开内容,由 AI 辅助整理改写后发布。

原标题:The builder’s guide to GPT‑5.6

阅读原文