智能工具库

Intel 将三值 LLM 从 1.58 比特压缩至 1.485 比特

Intel 将三值 LLM 从 1.58 比特压缩至 1.485 比特

Intel 通过 BitCos 技术在不修改任何权重的前提下,将 1.58-bit 三值大语言模型进一步压缩到 1.485 比特,本文解读其原理与对开发者的意义。

2026-09-18 0来源:The New Stack

三值量化已经足够小了吗?

近年来,大语言模型的量化压缩一直是推理部署领域的核心议题。从 FP16 到 INT8,再到 INT4、INT2,甚至三值(Ternary)量化,模型体积不断被压缩。三值量化将权重限制为 {-1, 0, +1} 三种取值,理论上每个权重仅需约 1.58 比特即可表示(因为需要额外编码区分三种状态而非两种)。

但 Intel 提出了一种更激进的做法:在完全不修改任何权重数值的前提下,将已经处于 1.58 比特的三值模型进一步压缩至 1.485 比特。这听起来近乎不可能——权重都没动,怎么还能更小?

BitCos 的核心思路

根据 Intel 的研究,其提出的 BitCos 技术并非对权重本身进行重新量化或裁剪,而是通过编码层面的优化来实现压缩。三值模型中,权重只有 -1、0、+1 三种可能取值,但传统编码方式(如用 2 比特表示三种状态)存在冗余。

BitCos 的关键在于:

  • 利用三值分布的统计特性:模型中 0 值通常占比最高,这为无损编码提供了天然的压缩空间。
  • 采用上下文相关的编码方案:根据相邻权重的取值模式,动态选择更高效的编码方式,从而在不丢失任何信息的前提下减少总比特数。
  • 零权重修改:解码后得到的权重与原始三值权重完全一致,不引入任何量化误差。

这意味着 BitCos 是一种无损压缩——模型精度完全不受影响,但存储和传输开销进一步降低。

对开发者和 AI 使用者的实际价值

1. 更小的模型体积,更低的部署成本

对于需要在边缘设备或资源受限环境中部署 LLM 的团队来说,每 0.1 比特的压缩都意味着可观的存储和带宽节省。以 7B 参数模型为例,从 1.58 比特降到 1.485 比特,模型文件可减少约 6% 的体积。

2. 三值量化的落地门槛进一步降低

三值量化虽然精度损失可控,但此前受限于模型体积仍偏大,在端侧部署时不够友好。BitCos 的压缩方案让三值模型更接近 INT4 甚至 INT3 模型的体积水平,为端侧推理提供了新的选项。

3. 无损压缩意味着无需重新验证精度

与有损量化不同,BitCos 不改变任何权重,因此不需要重新进行精度评估或微调。这大幅降低了采用门槛——开发者可以直接在现有三值模型上叠加 BitCos 压缩,无需额外的训练或验证流程。

技术解读:为什么"不改权重"还能压缩?

很多人可能会疑惑:如果权重完全不变,压缩从何而来?答案在于信息论中的熵编码。

三值模型中,权重的分布通常不是均匀的。例如,大量权重可能取值为 0,而 -1 和 +1 的分布也可能存在偏斜。传统的固定长度编码(如每个权重固定用 2 比特)无法利用这种不均匀性,而 BitCos 通过变长编码或上下文编码,让高频取值占用更少的比特,低频取值占用更多比特,从而在整体层面实现压缩。

这与哈夫曼编码、算术编码等经典无损压缩算法的思路一致,但 BitCos 针对三值 LLM 权重的特定分布模式进行了优化。

适用场景与建议

  • 端侧部署团队:如果你正在将 LLM 部署到手机、IoT 设备或嵌入式系统,BitCos 值得一试。更小的模型意味着更快的加载速度和更低的内存占用。
  • 模型分发场景:如果模型需要通过网络分发,更小的体积直接降低带宽成本。
  • 研究与实验:对于探索极端压缩的 AI 研究者,BitCos 提供了一个"无损压缩 + 三值量化"的组合方案,可以作为进一步优化的基线。

需要注意的是,BitCos 的压缩收益虽然看似微小(约 6%),但在大规模模型和大规模部署场景下,这种收益会被显著放大。对于追求极致体积控制的场景,这是一个值得关注的技术方向。

Featued image for: Intel squeezed a 1.58-bit LLM down to 1.485 bits without changing a single weight

本文基于 The New Stack 的公开内容,由 AI 辅助整理改写后发布。

原标题:Intel squeezed a 1.58-bit LLM down to 1.485 bits without changing a single weight

阅读原文