智能工具库

腾讯混元Hy4轻量版开源:1.5TB压缩至214GB,异构设备联合推理提速6倍

腾讯混元团队发布Hy4 preview轻量版,将770B参数模型压缩至214GB,借助稀疏三值量化与混合精度策略,性能几乎无损,并支持异构设备联合推理,推理速度提升6倍。

2026-09-01 0来源:IT之家

腾讯混元推出 Hy4 preview 轻量版:大模型瘦身新方案

9 月 1 日,腾讯混元团队宣布推出 Hy4 preview 轻量版,将原本接近 1.5TB 的模型权重压缩至约 214GB,降幅超过 85%。这一举措让超大参数模型在消费级硬件上运行成为可能,也为 AI 开发者和研究者提供了更实用的开源选择。

背景:Hy4 preview 原版模型

Hy4 preview 是腾讯于 8 月 28 日发布并开源的新一代 MoE(混合专家)大语言模型,总参数量高达 7700 亿(770B),激活参数为 490 亿(49B),上下文长度支持 100 万 Token。MoE 架构通过稀疏激活机制,在推理时只调用部分专家模块,从而在保持强大能力的同时降低计算成本。然而,原版模型权重体积庞大,对显存和存储要求极高,普通用户难以直接部署。

压缩技术:Sherry 算法与混合精度策略

轻量版的实现依托两项核心技术:

  • Sherry 稀疏三值量化算法:将路由专家层的权重压缩至平均 1.25 比特,大幅减少存储占用。
  • MIX-STQ1_0 混合精度策略:根据校准数据逐层决定量化位宽,对敏感层保留较高精度(2.06 比特 IQ2_XXS),对不敏感层采用更激进的 1.31 比特 STQ1_0。

这两种技术结合,使得模型在主流任务上表现稳定:长文理解能力几乎与原始 BF16 模型持平,多轮长上下文检索基本在同一水平,数学能力仅小幅回落。具体来看,MCP Atlas 得分从 83.7 微降至 83.2,SWE-Bench multi 从 82.9 降至 81.3,性能损失可忽略不计。

技术解读:BF16(bfloat16)是 AI 训练常用的低精度浮点格式,而 bpw(bits per weight)表示每个权重参数平均占用的比特数,数值越低压缩率越高。通过量化,模型体积大幅缩减,同时保持推理质量,这对资源受限的场景尤为重要。

异构设备联合推理:性能提升 6 倍

在部署方面,腾讯混元与 prima.cpp 合作验证了一项新方案:在一台配备单张 RTX 4090 的笔记本和一台四卡 A4000 服务器(合计 80GB 显存、64GB 内存,分属两个局域网)上,通过 prima.cpp 的异构调度将 MoE 层拆分分配,使 214GB 的轻量版模型达到 1.02 token/s 的推理速度,比笔记本单机 offload 快约 6 倍。

这一方案的意义在于,它打破了单机显存限制,让多台设备可以协同工作,为大模型在边缘设备、实验室等场景的部署提供了新思路。

开源与可用性

轻量版模型已上线 Hugging Face 和 GitHub 平台,支持 llama.cpp、vLLM、SGLang 等主流推理框架。开发者可直接下载量化 GGUF 文件(huggingface.co/AngelSlim/Hy4-preview-GGUF),或访问原模型(huggingface.co/tencent/Hy4-preview)及代码仓库(github.com/Tencent/AngelSlim)。

对于 AI 应用开发者而言,这意味着可以更轻松地在本地或小规模集群上运行千亿级参数模型,降低实验成本和部署门槛。

总结

腾讯混元轻量版通过先进的量化技术,将超大模型体积压缩至可管理范围,同时保持性能稳定,并借助异构设备联合推理提升实用性。这一进展不仅展示了 MoE 模型的优化潜力,也为开源社区提供了宝贵的实践案例。

本文基于 IT之家 的公开内容,由 AI 辅助整理改写后发布。

原标题:1.5TB 压到 214GB:腾讯混元 Hy4 preview 轻量版发布开源,异构设备可联合推理

阅读原文