大酷樂
  • 汽车
  • 理财
  • 军事
  • 科技
  • 游戏
  • 互联网
  • 娱乐
  • 财经
  • 科学
  • 社会
  • 亲子
  • 电影
  • 健康
  • 教育
  1. 首頁
  2. 科学

13.8倍吞吐提升!浙大上海AI Lab等提出视觉生成新范式,从“下一个token”到“下一个邻網域”

2025-03-30 简体 HK SG TW

今天小编分享的科学经验:13.8倍吞吐提升!浙大上海AI Lab等提出视觉生成新范式,从“下一个token”到“下一个邻網域”,欢迎阅读。

在影像 / 视频生成任务中,传统的 " 下一个 token 预测 " 方法正面临严重的效率瓶颈。

怎么办?

来自浙大、上海 AI Lab 等机构的研究人员提出了一种全新的视觉生成范式——邻近自回归建模(Neighboring Autoregressive Modeling, NAR)。与传统的 " 下一个 token 预测 " 不同,NAR 模型采用了 " 下一个邻網域预测 " 的机制,将视觉生成过程视为一种逐步扩展的 " 外绘 " 过程。

具体来说,NAR 模型从初始 token 开始,按照与初始 token 的曼哈顿距离从小到大依次生成 token。这种生成顺序不仅保留了视觉内容的空间和时间局部性,还允许模型在生成过程中并行预测多个相邻的 token。

为了实现这一点,研究人员引入了维度导向的解码头,每个头负责在空间或时间的一个正交维度上预测下一个 token。

通过这种方式,NAR 模型能够在每一步中并行生成多个 token,从而大幅减少了生成所需的模型前向计算步骤。

下面具体来看。

从 " 下一个 token" 到 " 下一个邻網域 "

在当今的 AI 领網域,视觉生成任务(如影像和视频生成)正变得越来越重要。无论是生成逼真的影像,还是创造连贯的视频,AI 模型的表现都在不断提升。

然而,现有的视觉生成模型,尤其是基于自回归(Autoregressive, AR)的模型,面临着严重的效率瓶颈。

传统的自回归模型通常采用 " 下一个 token 预测 " 的范式,即按照光栅顺序逐个生成影像或视频的 token。这种方法虽然简单直观,但在生成高分辨率影像或长视频时,模型需要进行数千次甚至数万次的前向计算,导致生成速度极其缓慢。

更糟糕的是,现有的加速方法往往以牺牲生成质量为代价。

例如,一些方法尝试通过并行生成多个 token 来提高效率,但由于邻近影像 token 之间的强相关性以及上下文信息的缺失,这种方法容易导致生成质量下降。

因此,如何在保持高质量生成的同时,大幅提升生成效率,成为了视觉生成领網域的一个关键挑战。

为了解决上述问题,研究人员提出了邻近自回归建模(NAR)。

正如一开头提到的,通过引入维度导向的解码头,使每个头负责在空间或时间的一个正交维度上预测下一个 token,最终让 NAR 模型能够在每一步中并行生成多个 token,从而大幅减少了生成所需的模型前向计算步骤。

值得一提的是,维度导向的解码头设计非常灵活,能够轻松扩展到更高维的视觉内容生成。

例如,在视频生成任务中,视频可以被视为三维数据(时间、行、列),NAR 模型只需增加一个时间维度的解码头,即可在时间、行、列三个正交维度上并行生成 token。

对于由 t × n × n 个 token 表示的视频,NAR 模型仅需 2n+t − 2 步即可完成生成过程,远远少于传统 " 下一个 token 预测 " 模型所需的 tn2   步。

这一显著的效率提升使得 NAR 模型在处理高分辨率视频生成任务时具有极大的优势。

13.8 倍吞吐提升

研究人员在多个视觉生成任务上对 NAR 模型进行了全面评估,实验结果令人振奋:

1、类别影像生成

在 ImageNet 256 × 256 数据集上,拥有 372M 参数的 NAR-L 取得了比拥有 1.4B 参数的 LlamaGen-XXL 更低的 FID(3.06 vs. 3.09),同时将生成步数减少了 87.8% 并带来了13.8 倍的吞吐提升 ( 195.4 images/s vs. 14.1 images/s ) 。

与 VAR-d16 模型相比,NAR-M 取得了更低的 FID 的同时(3.27 vs. 3.30),能带来 92% 的吞吐提升(248.5 images/s vs. 129.3 images/s)。

这说明与现有的自回归生成方法相比,NAR 模型在生成效率和质量上均取得了显著提升。

2、类别视频生成

在 UCF-101 数据集上,NAR 模型相比基于 " 下一个词预测 "(next-token prediction)的自回归模型在生成步骤上减少了 97.3%。

相比并行解码方法 PAR,NAR 在 FVD 更低的同时将吞吐提升了 8.6 倍。

这得益于 NAR 模型在时间维度上的并行生成能力,确保了视频帧之间的连贯性和高质量生成。

3、文本到影像生成

在 GenEval 基准测试中,NAR 模型仅使用了 0.4% 的训练数据(6M)便获得了和 Stable Diffusion v1.5 相持平的综合得分。

与参数量更大且拥有 1.4B 训练数据的 Chameleon-7B 模型相比,NAR 的综合得分更高(0.43 vs. 0.39)且将吞吐率提高了 166 倍。

这些实验结果不仅证明了 NAR 模型在生成效率上的巨大优势,还展示了其在生成质量上的卓越表现。

概括而言,NAR 模型为视觉生成任务提供了一种高效且高质量的解决方案,有望在未来的 AI 应用中发挥重要作用。

更多细节欢迎查阅原论文。

论文地址:

https://www.arxiv.org/abs/2503.10696

项目主页:

https://yuanyu0.github.io/nar/

代码地址:

https://github.com/ThisisBillhe/NAR

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

学术投稿请于工作日发邮件到:

[email protected]

标题注明【投稿】,告诉我们:

你是谁,从哪来,投稿内容‍

附上论文 / 项目主页链接,以及联系方式哦

我们会(尽量)及时回复你

点亮星标

科技前沿进展每日见

熱門排行
  • 王治郅:杨瀚森主要的问题是速度 他 王治郅:杨瀚森主要的问题是速度 他 郟君昊 | 2025-05-05
  • 贸易战烧进电影院:特朗普拟重税打击 贸易战烧进电影院:特朗普拟重税打击 習又夏 | 2025-05-05
  • 贷款追高炒黄金的人后悔了!有人一天 贷款追高炒黄金的人后悔了!有人一天 寸飛蘭 | 2025-05-05
  • 手机电池突破8000mAh?硅碳技术的回 手机电池突破8000mAh?硅碳技术的回 衛青柏 | 2025-05-05
  • 贷款追高炒黄金的人后悔了!有人一天 贷款追高炒黄金的人后悔了!有人一天 繁綺文 | 2025-05-05
  • 任天堂对Genki提起Switch 2商标侵 任天堂对Genki提起Switch 2商标侵 郜萌運 | 2025-05-05
  • 哪吒汽车APP和官网恢复正常 知情人 哪吒汽车APP和官网恢复正常 知情人 袁曼雁 | 2025-05-05
  • 极越汽车 CEO 夏一平名下青岛/义乌 极越汽车 CEO 夏一平名下青岛/义乌 集玲琳 | 2025-05-05
  • 全国经济第一大省明确,推动组建农商 全国经济第一大省明确,推动组建农商 佼昌翰 | 2025-05-05
  • 桑保利:亚马尔有配合意识&有点像梅 桑保利:亚马尔有配合意识&有点像梅 甄正浩 | 2025-05-05
  • 高露现身上海虹桥机场 黑色外套点缀亮色爱心装饰俏皮亮眼 高露现身上海虹桥机场 黑色外套点缀亮色爱心装饰俏皮亮眼 惠惠君 | 2023-05-02
  • 《歧路旅人2》:向光而生 《歧路旅人2》:向光而生 衛青柏 | 2023-05-02
  • vivo X90S曝光:处理器更新为天玑9200+ 安卓最强芯 vivo X90S曝光:处理器更新为天玑9200+ 安卓最强芯 袁曼雁 | 2023-05-05
  • “懒癌”发病率上升,定期体检别忽视 “懒癌”发病率上升,定期体检别忽视 幸聽楓 | 2023-05-02
  • 宋慧乔获百想视后 韩素希发图手动加爱心表情庆祝 宋慧乔获百想视后 韩素希发图手动加爱心表情庆祝 賁芳蕤 | 2023-05-02
  • 曹操墓,里面都有啥? 曹操墓,里面都有啥? 衛青柏 | 2023-05-02
  • 十年了,他们终于要HE! 十年了,他们终于要HE! 惠惠君 | 2023-05-07
  • 中央部署经济工作,释放5大信号 中央部署经济工作,释放5大信号 郜萌運 | 2023-05-02
  • 高德上线手机弯道会车预警功能 高德上线手机弯道会车预警功能 習又夏 | 2023-05-02
  • 陈自瑶抱病为爱女做蛋糕庆生,王浩信点赞没露面 陈自瑶抱病为爱女做蛋糕庆生,王浩信点赞没露面 賁芳蕤 | 2023-05-02
  • 等比例长大的童星,李兰迪算一个 等比例长大的童星,李兰迪算一个 郟君昊 | 2023-05-02
  • 这些被抓来做实验的流浪狗,最终拯救了无数糖尿病人 这些被抓来做实验的流浪狗,最终拯救了无数糖尿病人 集玲琳 | 2023-05-02
  • 高端国产车:军车血统,目前电动车越野的“天花板”? 高端国产车:军车血统,目前电动车越野的“天花板”? 謝飛揚 | 2023-05-02
  • 《云襄传》终于抬上来啦,男O女A让人好上头! 《云襄传》终于抬上来啦,男O女A让人好上头! 集玲琳 | 2023-05-02
  • 21家A股游戏公司2022年收入651亿 今年“游戏+AI”能否逆风翻盘? 21家A股游戏公司2022年收入651亿 今年“游戏+AI”能否逆风翻盘? 衛青柏 | 2023-05-04
  • 信用风险释放趋缓,结构性风险需重点关注 ——2023年一季度债市信用风险回顾与下阶段展望 信用风险释放趋缓,结构性风险需重点关注 ——2023年一季度债市信用风险回顾与下阶段展望 袁曼雁 | 2023-05-02
  • 与周立波夫妇闹纠纷成老赖,唐爽被司法拘留15日 与周立波夫妇闹纠纷成老赖,唐爽被司法拘留15日 寸飛蘭 | 2023-05-05
  • 普京签署总统令,批准对俄刑法典相关法条的修正案 普京签署总统令,批准对俄刑法典相关法条的修正案 集玲琳 | 2023-05-02
  • 解除资格!停止一切合作 解除资格!停止一切合作 佼昌翰 | 2023-05-02
  • 中银证券给予南京银行增持评级 中银证券给予南京银行增持评级 袁曼雁 | 2023-05-03
  • 3699起 联想小新mini主机上架 13代酷睿标压处理器 3699起 联想小新mini主机上架 13代酷睿标压处理器 習又夏 | 2023-05-05
  • 前董事长被免,天山生物全面进入“中植系”时代?股价曾在一月内暴涨超400% 前董事长被免,天山生物全面进入“中植系”时代?股价曾在一月内暴涨超400% 惠惠君 | 2023-05-02
  • 疯成这样,怎么还能被全网吹捧? 疯成这样,怎么还能被全网吹捧? 郜萌運 | 2023-05-02
  • 狂吼11次“让一下”!交警咆哮开道嘶吼到吐 狂吼11次“让一下”!交警咆哮开道嘶吼到吐 寸飛蘭 | 2023-05-03
  • 摩根大通收购美国第一共和银行 摩根大通收购美国第一共和银行 謝飛揚 | 2023-05-02
  • 台剧赢麻了,又来一部8.9 台剧赢麻了,又来一部8.9 衛青柏 | 2023-05-02
  • 事关农村土地承包和农民权益,《农村土地承包合同管理办法》5月1日起施行 事关农村土地承包和农民权益,《农村土地承包合同管理办法》5月1日起施行 郟君昊 | 2023-05-02
  • 下降45分,上涨35分!34所自划线院校复试分数线涨幅汇总 下降45分,上涨35分!34所自划线院校复试分数线涨幅汇总 袁曼雁 | 2023-05-07
  • "三高"已盯上青少年,做好这件事是关键 "三高"已盯上青少年,做好这件事是关键 習又夏 | 2023-05-05
  • 五一档没一个能打的 五一档没一个能打的 集玲琳 | 2023-05-05
  • 恐怖韩剧下神坛,这次胆小可入 恐怖韩剧下神坛,这次胆小可入 袁曼雁 | 2023-05-05
  • 这剧是不是用ChatGPT写的呀? 这剧是不是用ChatGPT写的呀? 惠惠君 | 2023-05-02
  • 200户连夜疏散,原因让人愤怒!“损失超一亿”,官方通报 200户连夜疏散,原因让人愤怒!“损失超一亿”,官方通报 袁曼雁 | 2023-05-03
  • 性骚扰惯犯,滚出娱乐圈 性骚扰惯犯,滚出娱乐圈 謝飛揚 | 2023-05-05
  • 48岁何炅自曝已老花眼,黄磊睡前认老,《向往的生活》证实将停办 48岁何炅自曝已老花眼,黄磊睡前认老,《向往的生活》证实将停办 佼昌翰 | 2023-05-02
  • 一个《长月烬明》倒了,《狐妖》《长相思》《与凤行》…在路上了 一个《长月烬明》倒了,《狐妖》《长相思》《与凤行》…在路上了 惠惠君 | 2023-05-02
  • 张天爱假期晒“酷”存照 卷发披肩穿黑色吊带裙大秀好身材 张天爱假期晒“酷”存照 卷发披肩穿黑色吊带裙大秀好身材 嬴覓晴 | 2023-05-02
  • 当年轻人开始不随份子钱 当年轻人开始不随份子钱 袁曼雁 | 2023-05-02
  • 毕滢用8年时间成功逼宫?曾被传已婚生子的她,不容小觑 毕滢用8年时间成功逼宫?曾被传已婚生子的她,不容小觑 幸聽楓 | 2023-05-03
  • 宋慧乔获视后首次晒照,拿奖杯笑容温柔 宋慧乔获视后首次晒照,拿奖杯笑容温柔 郜萌運 | 2023-05-02

©2022 大酷樂 版權所有

隱私政策 | 服務條款 | 聯繫我們