













扩散语言模型有望实现快速并行生成,而自回归(AR)模型通常因其因果结构与语言建模自然契合而在质量方面表现出色。
这就引出了一个根本性问题:我们能否实现高吞吐量、更高的 GPU 利用率和 AR 级别质量的协同作用?
现有方法未能有效地平衡这两个方面,要么通过使用较弱的模型进行顺序草稿(推测解码)来优先考虑 AR,导致草稿效率较低;要么对扩散模型使用某种从左到右(类似 AR)的解码逻辑,这仍然存在质量下降的问题,并丧失了其潜在的并行性。
在这项工作中,英伟达团队提出了一种序列级混合架构 TiDAR,在扩散中起草 token(Thinking),并自回归地采样最终输出(Talking)——所有这些都通过单个前向传播,使用专门设计的结构化注意力掩码实现。这种设计利用了自由的 GPU 计算密度,在草稿和验证能力之间实现了强有力的平衡。此外,TiDAR 被设计为一个独立模型,对服务友好(低开销)。
他们在 1.5B 和 8B 规模上,对生成和似然任务中的 TiDAR 与 AR 模型、推测解码和扩散变体进行了广泛评估。得益于并行草稿和采样以及精确的 KV 缓存支持,TiDAR 在测量的吞吐量上优于推测解码,并在效率和质量上超越了 Dream 和 Llada 等扩散模型。
值得注意的是,TiDAR 是首个在弥补与 AR 模型质量差距的同时,提供 4.71-5.91 倍 token/s 的架构。
paper 1083:TiDAR: Think in Diffusion, Talk in Autoregression
#大模型 #ai #论文 #扩散语言模型 #自回归模型 #英伟达 #带你一起读论文
这就引出了一个根本性问题:我们能否实现高吞吐量、更高的 GPU 利用率和 AR 级别质量的协同作用?
现有方法未能有效地平衡这两个方面,要么通过使用较弱的模型进行顺序草稿(推测解码)来优先考虑 AR,导致草稿效率较低;要么对扩散模型使用某种从左到右(类似 AR)的解码逻辑,这仍然存在质量下降的问题,并丧失了其潜在的并行性。
在这项工作中,英伟达团队提出了一种序列级混合架构 TiDAR,在扩散中起草 token(Thinking),并自回归地采样最终输出(Talking)——所有这些都通过单个前向传播,使用专门设计的结构化注意力掩码实现。这种设计利用了自由的 GPU 计算密度,在草稿和验证能力之间实现了强有力的平衡。此外,TiDAR 被设计为一个独立模型,对服务友好(低开销)。
他们在 1.5B 和 8B 规模上,对生成和似然任务中的 TiDAR 与 AR 模型、推测解码和扩散变体进行了广泛评估。得益于并行草稿和采样以及精确的 KV 缓存支持,TiDAR 在测量的吞吐量上优于推测解码,并在效率和质量上超越了 Dream 和 Llada 等扩散模型。
值得注意的是,TiDAR 是首个在弥补与 AR 模型质量差距的同时,提供 4.71-5.91 倍 token/s 的架构。
paper 1083:TiDAR: Think in Diffusion, Talk in Autoregression
#大模型 #ai #论文 #扩散语言模型 #自回归模型 #英伟达 #带你一起读论文


