Uber AI工厂:请求涨9倍,成本零增长

Uber公开其AI软件工厂的成本控制经验:通过智能体复用、缓存优化和模型分层,在请求量暴增9.4倍的情况下保持token成本不变。
2026-09-01 0来源:InfoQ 中文
背景:AI成本失控的行业痛点
随着大模型应用普及,开发者和企业普遍面临一个尴尬局面:智能体(Agent)调用量上去了,但token账单也跟着水涨船高。尤其在生产环境中,一次复杂任务可能触发数十次模型调用,成本呈指数级增长。Uber作为全球出行平台,其AI系统每天处理海量请求,如何在规模扩张的同时控制成本,成为行业关注焦点。
Uber的实践:请求量暴增,成本却稳如泰山
Uber在近期公开的技术分享中透露,其内部AI软件工厂(AI Software Factory)在请求量增长9.4倍的情况下,token支出却保持零增长。这一成果并非靠压缩功能或降低服务质量,而是通过一系列架构和工程优化实现。
核心策略一:智能体复用与缓存
Uber发现,许多请求在语义上高度相似,尤其是重复性任务(如订单状态查询、路线规划)。为此,他们构建了多级缓存体系:
- 结果级缓存:对完全相同或近似相同的请求,直接返回历史结果,避免重复调用模型。
- 语义缓存:利用向量数据库对用户输入进行语义匹配,即使表述不同但意图相同,也能命中缓存。
- 中间状态缓存:在多步智能体流程中,缓存每一步的中间输出,避免因某一步失败而重跑全部流程。
这一策略直接削减了约60%的模型调用次数。
核心策略二:模型分层与路由
Uber没有对所有请求使用同一模型,而是建立了一个模型路由层,根据任务复杂度动态选择模型:
- 简单任务(如实体抽取、格式转换)使用轻量级模型(如Llama 3 8B),成本仅为旗舰模型的1/20。
- 中等任务(如意图分类、摘要)使用中型模型(如Mistral 7B)。
- 复杂推理(如多步规划、代码生成)才调用旗舰模型(如GPT-4或Claude 3)。
通过引入开源模型和自蒸馏模型,Uber将旗舰模型的调用比例从80%降至30%,显著拉低平均成本。
核心策略三:上下文压缩与提示优化
长上下文是token消耗的大头。Uber采用动态上下文裁剪技术:
- 在对话历史中,自动移除无关信息,只保留关键实体和意图。
- 对长文档先进行摘要,再输入模型。
- 使用结构化提示词,减少冗余描述。
此外,他们开发了token预算控制机制,为每个请求设定最大token上限,超出部分自动截断或降级处理。
对开发者的实用启示
Uber的经验并非高不可攀,以下措施可以立即落地:
- 先加缓存,再调模型:在开发初期就设计缓存层,尤其是对高重复率的业务场景。
- 建立模型路由:不要“一刀切”使用最强模型,评估任务难度,按需分配。
- 监控token消耗:在日志中记录每次调用的token数,定期分析热点。
- 利用开源模型:对于内部工具或非关键路径,可部署开源模型(如Llama 3)降低成本。
总结
Uber的案例证明,AI成本控制不是靠“少用”,而是靠“巧用”。通过缓存、路由和压缩,开发者可以在不牺牲体验的前提下,让token账单回归理性。对于正在构建智能体应用的技术团队,这些方法值得借鉴。