Multiverse Computing 8 月 25 日在 Hugging Face 上介绍了一套叫 Quantization-Aware Healing 的做法,缩写 QAH。常规的量化后修复是拿压缩后的检查点当老师做蒸馏,QAH 直接从压缩前的原始模型蒸馏,师生两边架构不一样,学生只从老师的 logits 学,用 KL 散度对齐,损失做了分块处理以便 32k 上下文能塞进显存。
实验对象是 OpenAI 的 GPT-OSS 120B,先结构化压缩到 600 亿参数,再量化到 MXFP4 也就是 4 比特。对照是同一个 60B 的 BF16 恢复版本。九个基准里 QAH 的 4 比特版赢了七个,AA-LCR 长上下文从 35.3 提到 42.7,AIME 2025 从 70.7 到 76.3,Aider 38.2 到 40.9,GPQA Diamond 65.7 到 67.4,IFBench 58.4 到 59.9。输的两个是 MMLU-Pro 掉 0.2、SciCode 掉 1.4。LiveCodeBench 上 4 比特版 66.5,比 120B 老师的 66.0 还高半点。
和量化感知训练的正面比较用的是一个 9B 的 GPT-OSS。两者峰值几乎打平,QAH 54.9、QAT 54.6,差别在过程。QAH 大约 100 步就到峰值并且此后保持稳定,QAT 要 700 步左右,过了峰值急转直下,到第 1200 步大约掉了 19 分。
模型挂在 Hugging Face 上,名字是 MultiverseComputingCAI/Hypernova-60B-2605,论文编号 2608.20953。