推广 热搜: 采购方式  滤芯  带式称重给煤机  甲带  气动隔膜泵  减速机型号  无级变速机  链式给煤机  履带  减速机 

英伟达:在扩散中思考,在自回归中交流

   日期:2025-11-17 13:50:50     来源:网络整理    作者:本站编辑    评论:0    
英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

英伟达:在扩散中思考,在自回归中交流

扩散语言模型有望实现快速并行生成,而自回归(AR)模型通常因其因果结构与语言建模自然契合而在质量方面表现出色。

这就引出了一个根本性问题:我们能否实现高吞吐量、更高的 GPU 利用率和 AR 级别质量的协同作用?

现有方法未能有效地平衡这两个方面,要么通过使用较弱的模型进行顺序草稿(推测解码)来优先考虑 AR,导致草稿效率较低;要么对扩散模型使用某种从左到右(类似 AR)的解码逻辑,这仍然存在质量下降的问题,并丧失了其潜在的并行性。

在这项工作中,英伟达团队提出了一种序列级混合架构 TiDAR,在扩散中起草 token(Thinking),并自回归地采样最终输出(Talking)——所有这些都通过单个前向传播,使用专门设计的结构化注意力掩码实现。这种设计利用了自由的 GPU 计算密度,在草稿和验证能力之间实现了强有力的平衡。此外,TiDAR 被设计为一个独立模型,对服务友好(低开销)。

他们在 1.5B 和 8B 规模上,对生成和似然任务中的 TiDAR 与 AR 模型、推测解码和扩散变体进行了广泛评估。得益于并行草稿和采样以及精确的 KV 缓存支持,TiDAR 在测量的吞吐量上优于推测解码,并在效率和质量上超越了 Dream 和 Llada 等扩散模型。

值得注意的是,TiDAR 是首个在弥补与 AR 模型质量差距的同时,提供 4.71-5.91 倍 token/s 的架构。

paper 1083:TiDAR: Think in Diffusion, Talk in Autoregression

#大模型 #ai #论文 #扩散语言模型 #自回归模型 #英伟达 #带你一起读论文
 
打赏
 
更多>同类资讯
0相关评论

推荐图文
推荐资讯
点击排行
网站首页  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报  |  皖ICP备20008326号-18
Powered By DESTOON