Intel新突破:1.485bit压缩技术,解码提速27%

Intel推出BITCOS格式,在保持权重不变的情况下,将三进制模型压缩至1.485bit,大幅提升GPU解码速度。
Intel新突破:1.485bit压缩技术,解码提速27%
随着大语言模型(LLM)的爆发,显存和计算资源的消耗成为制约其部署的关键瓶颈。为了在有限的硬件资源上运行更庞大的模型,模型量化技术应运而生。近日,Intel 在这一领域取得了显著进展,推出了一种名为 BITCOS 的全新权重压缩格式,在不改变模型原始权重的前提下,实现了超低比特压缩,并带来了显著的性能提升。
什么是 BITCOS 格式?
BITCOS(Binary Ternary Compression)是 Intel 开发的一种专门针对三进制模型权重的压缩方案。传统的量化技术通常将模型权重压缩为二进制(0 或 1),而 BITCOS 则利用三进制系统(-1, 0, 1),这通常能比二进制更精细地表示模型的特征。
Intel 的这项技术亮点在于其无损性:它不需要对模型进行微调,也不改变权重本身的数值,而是通过一种更高效的存储编码方式,将原本需要 1.58 bit 存储的权重,压缩到了 1.485 bit。
核心技术:利用零重分布
BITCOS 格式之所以能实现如此极致的压缩,归功于对零重分布的深度利用。
在神经网络训练完成后,其权重矩阵中往往存在大量数值接近零的权重。这被称为“稀疏性”。BITCOS 算法敏锐地捕捉到了这一特性,通过特定的编码策略,专门针对这些接近零的权重进行高效压缩。
这种策略不仅减少了存储空间,更关键的是减少了计算时的数据搬运量。对于开发者而言,这意味着在同样的显存带宽下,可以加载更多的模型参数,或者在模型参数量不变的情况下,大幅降低显存占用。
实战价值:解码速度提升 27%
对于 AI 开发者和部署者来说,BITCOS 带来的最直接红利是推理速度的提升。
测试数据显示,基于 BITCOS 压缩的模型在 GPU 上的解码速度最高可提升 27%。
这一提升主要来自于两个层面:
- 数据传输减少:由于压缩后的数据量更小,GPU 在读取权重时的 I/O 延迟降低。
- 计算效率优化:针对稀疏权重的优化计算指令(SIMD)能够更高效地处理大部分为零的权重,避免无效计算。
对开发者和 AI 使用者的意义
对于 AI 硬件开发者和部署者,BITCOS 提供了一种极具吸引力的“低成本”优化方案:
- 降低硬件门槛:通过压缩模型,开发者可以在消费级显卡(如 RTX 30/40 系列)上运行原本需要高端旗舰卡才能承载的大模型,降低了边缘计算设备的部署成本。
- 灵活的部署策略:由于不需要更改权重,开发者可以轻松地将这种压缩格式集成到现有的推理管线中,无需担心模型精度损失或重新训练的麻烦。
- 绿色计算:更快的解码速度意味着在同等任务下,硬件功耗可以降低,有助于构建更环保的 AI 服务。
总结来说,Intel 的 BITCOS 技术通过数学上的巧妙编码,解决了模型压缩与计算速度之间的矛盾,为未来大模型在消费级硬件上的普及提供了强有力的技术支撑。
本文基于 The New Stack 的公开内容,由 AI 辅助整理改写后发布。
原标题:Intel squeezed a 1.58-bit LLM down to 1.485 bits without changing a single weight
阅读原文