返回快讯列表
大模型前沿

HC-DLM 把连续潜变量和离散 token 反馈合在扩散语言模型里

论文提出分层连续扩散语言模型,让 token 在每一步从共享潜变量读出并反过来帮助下一步更新,在三个任务上超过对照扩散模型。

Hierarchical Continuous Diffusion Language Models 论文针对扩散语言模型的一个结构问题:并行解码时,各 token 如果只按边缘概率独立采样,彼此之间的统计依赖会被切断;而连续扩散模型又可能一直停留在没有明确 token 约束的潜变量状态。

HC-DLM 把离散 token 与连续潜变量轨迹放到同一个去噪过程里。每一步从潜变量读出 token,并把这个 token 作为下一次潜变量更新的支架。作者把训练目标从 token 似然的变分界推导出来,使离散序列约束和连续状态更新保持在同一框架内。

在 Sudoku、Countdown 数学规划和 LM1B 语言建模上,论文报告 HC-DLM 在相同模型规模下优于离散与连续扩散基线。研究仍是论文中的实验实现,没有给出适合生产服务的吞吐、模型规模或长文本成本结论。它更像是扩散语言模型在结构化推理任务上的一个可复现研究方向。

更多快讯