Chunlin 的论文科普

扩散语言模型生成不通顺?显式建模词依赖能解决吗

并行生成的老毛病:各猜各的,拼起来不通

你有没有用过主打”几秒出一大段”的AI写作工具?速度确实快,但仔细一读,要么前后句逻辑接不上,要么同一个意思翻来覆去说,活像好几个人各写各的句子硬拼在一起。这不是模型能力不够,而是**扩散语言模型(Diffusion Language Model, DLM)**这类并行生成架构的先天特点:每一步同时预测多个词,但每个词的预测是条件独立的,互相不打招呼 [1]。

打个比方:传统自回归模型像单人写文章,一个字一个字往后写,前面写什么后面清清楚楚,所以连贯性好,但速度慢;扩散语言模型则像一群人分工写一篇文章的不同位置,每人只看自己周围的一点上下文,同时动笔——好处是快,坏处是容易出现”你写的开头和我写的结尾接不上”的尴尬 [1]。

这个问题其实是个老熟人了。早年非自回归翻译(Non-Autoregressive Translation, NAT)领域就遇到过几乎一模一样的”多模态问题”:因为每个位置的翻译独立预测,经常出现搭配不当、重复、漏词等毛病。那NAT是怎么解决的?其中一个思路就是用**有向无环图(Directed Acyclic Graph, DAG)**显式建模词和词之间的依赖关系,代表工作是 Directed Acyclic Transformer(DAT)[1]。

那能不能把DAG这套”让词之间彼此照应”的思路搬到扩散语言模型里?直接搬不行——NAT是一步生成,扩散模型是迭代去噪,每步都会有一部分词从不确定变确定,图的结构得跟着变。DA-DLM(Directed Acyclic Diffusion Language Model)这篇论文就是来解决这个适配问题的 [1]。

DA-DLM 的思路:用「位置导向 DAG」搭脚手架

DA-DLM 的核心设计叫位置导向 DAG(position-oriented DAG),你可以把它想象成”搭脚手架式生成” [1]。

先解释几个基本概念:

位置导向 DAG 的运作方式是这样的:每个输出位置绑定一组候选节点,一条合法路径必须从每组里选一个节点,路径长度固定等于输出长度——这保证了跨步骤的位置稳定性,不会出现NAT里位置乱飘的问题。随着去噪推进,越来越多的位置被确定下来,候选组就退化成单节点的”锚点”,所有路径都必须经过这些锚点;剩下还没确定的位置保留候选组,整张图就像被逐渐”收窄”,不确定性越来越小 [1]。

当然,实际情况比这个比喻更复杂。训练的时候,DA-DLM 没有像普通扩散模型那样计算每个位置的独立对数似然,而是用前向算法把所有可能路径的联合似然边缘化——复杂度是 O(NK²),比起位置自由的DAG那种 O(N³K²) 的复杂度要高效得多,这也是位置导向设计带来的好处 [1]。

推理的时候就更有意思了:你可以用**维特比解码(Viterbi Decoding)**找最优路径,也可以采样路径,而且不需要像有些NAT模型那样额外做长度搜索。DA-DLM 还提出了一个”发射概率+转移概率”的复合置信度分数,用来判断哪些词该在这一步确定为锚点、哪些还得继续掩着;再加上基于锚点间隙的 infilling 加速策略,进一步提升了生成效率 [1]。

效果如何:少步数下提升最明显

说了这么多设计,到底有没有用?我们来看实验数据。所有实验都基于 BD3LM(Block Diffusion)这个基线模型做改进,DA-DLM 只增加了约 2.5M 参数,大约是骨干参数的 2%,代价非常小 [1]。

先看语言建模任务,指标是困惑度(perplexity,越低越好):

提升看起来不算特别惊人,但别忘了这是在几乎不增加参数的情况下拿到的。更关键的差距出现在开放生成任务,尤其是少去噪步数的场景——这正是并行生成最有价值的”极速模式”:

用 LLM 当裁判来比的话,DA-DLM 的胜率也很可观:16 步时胜率 65.38%,4 步时更是达到 74.02%(95% 置信区间 [71.66, 76.25])[1]。

再看摘要任务,这是和自回归(AR)模型正面刚的场景:

效率方面呢?块大小 16 时,BD3LM 单步延迟 27.59ms,DA-DLM 是 29.60ms,只慢了 7.3%;峰值内存最多差 76MiB,只多了 2.0% [1]。考虑到质量提升,这个代价可以说相当划算。

一脉相承:从非自回归翻译到扩散模型的依赖建模

读到这里你可能已经发现了,DA-DLM 的思路和非自回归翻译里的 DAT 非常像——没错,作者自己也明确说了,这篇工作就是把 DAT 那套 DAG 依赖建模思路,适配到扩散语言模型的迭代去噪场景里 [1]。

为什么需要”适配”,不能直接拿来用?因为两个场景的生成范式有本质区别:

位置导向 DAG 就是为了解决这个不兼容问题而生的。它把节点组绑定到固定的输出位置上,这样即使图在收缩,位置关系始终是稳定的;早期确定的词变成锚点,给相邻位置的预测提供”抓手”——这和 DAT 里 DAG 用来消解多模态歧义的作用是一致的,但适应了迭代式的生成节奏 [1]。

训练目标的改造也体现了这种一脉相承:DAT 用路径的联合似然替代逐位置独立似然,DA-DLM 做了同样的事情,只是把它嵌入到了 BD3LM 的块自回归因子化 + 连续时间掩码扩散框架里 [1]。

扩散语言模型的提速之路:这一步走到了哪

DA-DLM 不是第一个试图解决”扩散模型生成质量 vs 速度”权衡的工作。把它放进整个 DLM 演进的脉络里看,会更清楚它的位置。

早期的扩散语言模型主要靠采样策略优化来提速。比如 PUNT(Parallel Sampling from Masked Diffusion Models via Conditional Independence Testing)就是一个模型无关的采样器,它通过条件独立性测试来找出哪些词可以安全地并行解锁——既要保证同时更新的词之间条件独立,又要优先解锁高置信度的预测,在两者之间做权衡。实验显示 PUNT 在 IFEval 基准上比顺序生成准确率高出最多 16%,尤其在长序列上优势明显 [6]。

另一路思路是架构层面的改造。E2D2(Encoder-Decoder Diffusion Language Models)观察到离散扩散模型其实在做两件事:表示干净词元、给带噪序列去噪。既然是两件事,就可以用两个模块分别做——编码器负责表示干净词元,轻量解码器负责迭代去噪,这样每一步去噪不用跑整个大模型,速度自然就上去了。E2D2 在摘要、翻译和数学推理任务上都取得了更好的质量-吞吐权衡 [7]。

还有一条路是融合自回归与扩散的优点。ARMD(Auto-Regressive Masked Diffusion)把掩码扩散过程重新定义为块状因果模型,设计了一个严格因果、排列等变的架构,可以在单次前向传播中计算多个去噪步的所有条件概率。它还提出了一种”跨步并行生成”策略,让模型在保持全局连贯性的同时,以并行流的方式生成词元,既缩小了与自回归模型的性能差距,又保留了并行生成的速度优势 [8]。

DA-DLM 走的是另一条路:不在采样策略或架构拆分上做文章,而是直接从”并行生成为什么质量差”这个根因入手——因为词之间缺乏显式依赖建模。它用位置导向 DAG 补上了这一环,尤其在少步数场景下效果突出,可以说是从”依赖建模”这个维度给 DLM 的提速之路添了一块拼图 [1]。

还剩什么问题:规模、长依赖与更多任务

说了这么多优点,也得客观聊聊 DA-DLM 的局限和待解的问题。

首先,实验规模比较小。作者自己也承认,受计算资源限制,所有实验都是在较小的模型规模上做的,更大的开源离散扩散模型上效果如何还需要进一步验证 [1]。这个问题在 DLM 领域很常见——毕竟扩散模型训练本身就比自回归模型更吃算力。

其次,DAG 本身的依赖范围有限。位置导向 DAG 只建模相邻位置组之间的转移概率,长距离依赖其实还是靠骨干模型的注意力机制来处理的,DAG 本身并没有直接建模跨多个位置的依赖关系 [1]。对于需要长程连贯的生成任务(比如长篇小说、技术文档),这个设计能起多大作用还不好说。

第三,评估任务范围还比较窄。目前只在语言建模、开放生成和摘要任务上做了验证,像数学推理、代码生成这些现代大语言模型的核心能力场景还没测 [1]。这些任务对逻辑连贯性和结构正确性的要求更高,显式依赖建模会不会有更大的用武之地?还是说 DAG 的相邻转移建模太浅,hold 不住复杂推理?这些都还是未知数。

最后,和自回归模型的对比也还不够系统。论文里只在摘要任务和 MAUVE 指标上给出了 AR 参考值,没有完整地画出质量-速度的帕累托曲线,我们还不太清楚 DA-DLM 在整个权衡空间里到底处于什么位置 [1]。

如果你只记住一件事

DA-DLM 用位置导向的有向无环图,给并行生成的扩散语言模型补上了显式的词元依赖建模,只增加约 2% 的参数,就在少步数的极速模式下把生成质量的底线拉高了 3 倍,还能追上自回归模型的质量、同时保留并行生成的速度优势 [1]。


参考文献

  1. DA-DLM: Explicitly Modeling Token Dependencies in Diffusion Language Models(arXiv、2026、全文精读)
  2. Online Language Adaptive Sampling for Better Distributed Cross-lingual Gains(arXiv、2026、全文精读)
  3. Atria Dawn: The Dawn of Agentic Superintelligence(arXiv、2026、全文精读)
  4. Token Efficient Task Execution via Application Behavior Modeling for Web Agents(arXiv、2026、全文精读)
  5. Mind Which Bird You Favour: Parameterizing Adequacy-Fluency Balance in Meta-Evaluation of Machine Translation(arXiv、2026、全文精读)
  6. Parallel Sampling from Masked Diffusion Models via Conditional Independence Testing(ArXiv.org、2025、仅摘要)
  7. Encoder-Decoder Diffusion Language Models for Efficient Training and Inference(ArXiv.org、2025、仅摘要)
  8. Auto-Regressive Masked Diffusion Models(ArXiv.org、2026、仅摘要)