大酷樂
  • 汽车
  • 理财
  • 军事
  • 科技
  • 游戏
  • 互联网
  • 娱乐
  • 财经
  • 科学
  • 社会
  • 亲子
  • 电影
  • 健康
  • 教育
  1. 首頁
  2. 互联网

在马斯克和奥特曼比谁喊的响的时候,DeepSeek低调发论文,梁文锋亲自参与

2025-02-19 简体 HK SG TW

今天小编分享的互联网经验:在马斯克和奥特曼比谁喊的响的时候,DeepSeek低调发论文,梁文锋亲自参与,欢迎阅读。

当马斯克高调推出基于 20 万块 GPU 集群的 Grok-3、Sam Altman 在开源策略上反复权衡之际,DeepSeek 悄然发布了一项可能改变游戏规则的技术。

18 日,DeepSeek CEO公布了一项由梁文锋亲自参与的研究论文成果——原生稀疏注意力(Native Sparse Attention, NSA)机制。这是 DeepSeek 团队在稀疏注意力领網域的创新性工作,结合了算法创新和硬體优化,旨在解决长上下文建模中的计算瓶颈。

DeepSeek 论文显示,NSA 不仅将大语言模型处理 64k 长文本的速度最高提升 11.6 倍,更在通用基准测试中实现性能反超传统全注意力模型。在全球 AI 竞赛转向 " 硬核创新 " 的当口,这家低调的中国公司展示了技术破局的新范式。

值得注意的是,NSA 尚未应用于 DeepSeek V3 的训练中。这意味着,如果后续 DeepSeek 将 NSA 整合到模型训练中,其基座模型的能力有望实现显著提升。论文中明确指出:" 使用 NSA 预训练的模型超过了全注意力模型 "。

与 DeepSeek 形成鲜明对比的是,xAI 选择了另一条道路:对工程规模的极致追求。今日马斯克发布的 Grok3 使用了 20 万块 GPU 集群,而未来的 Grok4 更是计划使用百万块 GPU、1.2GW 的集群。这种 " 财大气粗 " 的做法,体现了北美在 AI 领網域一贯的 " 大力出奇迹 " 风格。

稀疏注意力:DeepSeek NSA 的创新之道

"AI 革命 " 狂飙突进,长文本建模在 AI 领網域的重要性日益凸显。OpenAI 的 o-series 模型、DeepSeek-R1 以及 Google Gemini 1.5 Pro 等,都展示了处理超长文本的强大潜力。

然而,传统 Attention 机制的计算复杂度随序列长度呈平方级增长,成为制约大语言模型(LLM)发展的关键瓶颈。

稀疏注意力机制被认为是解决这一难题的希望所在。DeepSeek 今日提出的 NSA 机制,正对去年 5 月 MLA(Multi-Layer Attention)工作的补充。NSA 的核心在于将算法创新与硬體优化相结合,实现了高效的长文本建模。

科技媒体AI 寒武纪表示,NSA 的三大关键创新包括:

动态分层稀疏策略:结合粗粒度 Token 压缩和细粒度 Token 选择,兼顾全局上下文感知和局部信息精确性。

算术强度平衡的设计:针对现代硬體进行优化,显著提升计算速度。

端到端可训练:支持端到端训练,减少预训练计算量,同时保持模型性能。

NSA 的核心组件:三位一体,逐层优化

科技自媒体zartbot分析,NSA 架构采用了分层 Token 建模,通过三个并行的注意力分支处理输入序列:

压缩注意力(Compressed Attention): 通过压缩 Token 块来捕获全局信息,处理粗粒度的模式。

选择注意力(Selected Attention): 处理重要的 Token 块,选择性地保留细粒度的信息。

滑动視窗注意力(Sliding Window Attention): 处理局部上下文信息。

这三个分支的输出通过一个门控机制进行聚合。为了最大化效率,NSA 还专门设计了硬體优化的 Kernel。

具体而言,NSA 在 Token Compression 部分,基于 block 粒度进行压缩计算,并插入位置信息编码。在 Token Selection 部分,则巧妙地借用 Compression 的注意力分数作为 block 的重要性分数,进行 top-N 选择,以保留关键的细粒度信息。Sliding Window 部分则负责处理局部上下文。最后,通过 Gating 函数综合三种注意力的输出。

实验结果:性能与效率的双重飞跃

根据 DeepSeek 发布的实验数据,NSA 技术在多个方面展现出卓越表现。

在通用基准测试、长文本任务和指令推理方面,使用 NSA 预训练的模型性能不仅没有下降,反而超越了 Full Attention 模型。更重要的是,在处理 64k 长度的序列时,NSA 在解码、前向传播和反向传播等各个阶段都实现了显著的速度提升,最高可达 11.6 倍,证明了 NSA 在模型生命周期各个阶段的效率优势。

AI 寒武纪表示:

"DeepSeek 的 NSA 技术为长文本建模带来了新的突破。它不仅在性能上超越了传统的 Full Attention 模型,更在效率方面实现了显著的提升,尤其是在长序列场景下。NSA 的 硬體友好设计 和 训推一体化特性,使其在实际应用中更具优势,有望加速下一代 LLM 在长文本处理领網域的应用落地。"

科技媒体信息平权表示,NSA 论文中隐藏了一个 " 彩蛋 ":

"DeepSeek 此次使用了 Triton,而没有提及英伟达专用库和框架。Triton 底层可以调用 CUDA,也可以调用其他计算平台的框架,如 AMD 的 ROCM,甚至国产计算卡。结合 NSA 降低了浮点算力和内存占用门槛的特性,这或许暗示了 DeepSeek 在模型研发阶段,就已经开始考虑未来适配更多类型计算卡,为更广泛、更普遍的开源做准备。"

xAI 的 Grok3:算力堆砌的 " 极致 "

与 DeepSeek 形成鲜明对比的是,xAI 选择了另一条道路:对工程规模的极致追求。Grok3 使用了 20 万块 GPU 集群,而未来的 Grok4 更是计划使用百万块 GPU、1.2GW 的集群。这种 " 财大气粗 " 的做法,体现了北美在 AI 领網域一贯的 " 大力出奇迹 " 风格。

然而,信息平权的分析指出,尽管 xAI 通过超大集群在短时间内实现了对之前 SOTA(State-of-the-Art)模型的反超,但其投入产出比并不理想。相比 DeepSeek V3,xAI 以 50 倍的成本实现了 30% 的性能提升。这表明,单纯在预训练阶段投入巨额算力,其收益可能并不如预期,将资源投入到 RL(强化学习)后训练阶段可能更为划算。

熱門排行
  • 王治郅:杨瀚森主要的问题是速度 他的速度跟不上现代篮球的节奏 王治郅:杨瀚森主要的问题是速度 他的速度跟 郟君昊 | 2025-05-05
  • 贸易战烧进电影院:特朗普拟重税打击外国电影 逼好莱坞等回美拍片 贸易战烧进电影院:特朗普拟重税打击外国电影 習又夏 | 2025-05-05
  • 贷款追高炒黄金的人后悔了!有人一天亏掉6年工资,卖掉舍不得,不卖扛不住 贷款追高炒黄金的人后悔了!有人一天亏掉6年 寸飛蘭 | 2025-05-05
  • 手机电池突破8000mAh?硅碳技术的回旋镖:「折寿」换容量 手机电池突破8000mAh?硅碳技术的回旋镖:「折 衛青柏 | 2025-05-05
  • 贷款追高炒黄金的人后悔了!有人一天亏掉6年工资,卖掉舍不得,不卖扛不住 贷款追高炒黄金的人后悔了!有人一天亏掉6年 繁綺文 | 2025-05-05
  • 任天堂对Genki提起Switch 2商标侵权诉讼,后者回应称将严肃对待 任天堂对Genki提起Switch 2商标侵权诉讼,后 郜萌運 | 2025-05-05
  • 哪吒汽车APP和官网恢复正常 知情人士:之前断网因流量欠费 哪吒汽车APP和官网恢复正常 知情人士:之前断 袁曼雁 | 2025-05-05
  • 极越汽车 CEO 夏一平名下青岛/义乌两家公司被列入经营异常 极越汽车 CEO 夏一平名下青岛/义乌两家公司 集玲琳 | 2025-05-05
  • 全国经济第一大省明确,推动组建农商联合银行 全国经济第一大省明确,推动组建农商联合银行 佼昌翰 | 2025-05-05
  • 桑保利:亚马尔有配合意识&有点像梅西 姆巴佩更专注进球&更像C罗 桑保利:亚马尔有配合意识&有点像梅西 姆巴佩 甄正浩 | 2025-05-05
  • 高露现身上海虹桥机场 黑色外套点缀亮色爱心装饰俏皮亮眼 高露现身上海虹桥机场 黑色外套点缀亮色爱 惠惠君 | 2023-05-02
  • 《歧路旅人2》:向光而生 《歧路旅人2》:向光而生 衛青柏 | 2023-05-02
  • vivo X90S曝光:处理器更新为天玑9200+ 安卓最强芯 vivo X90S曝光:处理器更新为天玑9200+ 安卓最 袁曼雁 | 2023-05-05
  • “懒癌”发病率上升,定期体检别忽视 “懒癌”发病率上升,定期体检别忽视 幸聽楓 | 2023-05-02
  • 曹操墓,里面都有啥? 曹操墓,里面都有啥? 衛青柏 | 2023-05-02
  • 宋慧乔获百想视后 韩素希发图手动加爱心表情庆祝 宋慧乔获百想视后 韩素希发图手动加爱心表 賁芳蕤 | 2023-05-02
  • 十年了,他们终于要HE! 十年了,他们终于要HE! 惠惠君 | 2023-05-07
  • 中央部署经济工作,释放5大信号 中央部署经济工作,释放5大信号 郜萌運 | 2023-05-02
  • 高德上线手机弯道会车预警功能 高德上线手机弯道会车预警功能 習又夏 | 2023-05-02
  • 陈自瑶抱病为爱女做蛋糕庆生,王浩信点赞没露面 陈自瑶抱病为爱女做蛋糕庆生,王浩信点赞没露 賁芳蕤 | 2023-05-02
  • 等比例长大的童星,李兰迪算一个 等比例长大的童星,李兰迪算一个 郟君昊 | 2023-05-02
  • 高端国产车:军车血统,目前电动车越野的“天花板”? 高端国产车:军车血统,目前电动车越野的“天花 謝飛揚 | 2023-05-02
  • 这些被抓来做实验的流浪狗,最终拯救了无数糖尿病人 这些被抓来做实验的流浪狗,最终拯救了无数糖 集玲琳 | 2023-05-02
  • 《云襄传》终于抬上来啦,男O女A让人好上头! 《云襄传》终于抬上来啦,男O女A让人好上头! 集玲琳 | 2023-05-02
  • 21家A股游戏公司2022年收入651亿 今年“游戏+AI”能否逆风翻盘? 21家A股游戏公司2022年收入651亿 今年“游 衛青柏 | 2023-05-04
  • 信用风险释放趋缓,结构性风险需重点关注 ——2023年一季度债市信用风险回顾与下阶段展望 信用风险释放趋缓,结构性风险需重点关注 — 袁曼雁 | 2023-05-02
  • 与周立波夫妇闹纠纷成老赖,唐爽被司法拘留15日 与周立波夫妇闹纠纷成老赖,唐爽被司法拘留15 寸飛蘭 | 2023-05-05
  • 普京签署总统令,批准对俄刑法典相关法条的修正案 普京签署总统令,批准对俄刑法典相关法条的修 集玲琳 | 2023-05-02
  • 解除资格!停止一切合作 解除资格!停止一切合作 佼昌翰 | 2023-05-02
  • 中银证券给予南京银行增持评级 中银证券给予南京银行增持评级 袁曼雁 | 2023-05-03
  • 3699起 联想小新mini主机上架 13代酷睿标压处理器 3699起 联想小新mini主机上架 13代酷睿标压 習又夏 | 2023-05-05
  • 前董事长被免,天山生物全面进入“中植系”时代?股价曾在一月内暴涨超400% 前董事长被免,天山生物全面进入“中植系”时 惠惠君 | 2023-05-02
  • 疯成这样,怎么还能被全网吹捧? 疯成这样,怎么还能被全网吹捧? 郜萌運 | 2023-05-02
  • 狂吼11次“让一下”!交警咆哮开道嘶吼到吐 狂吼11次“让一下”!交警咆哮开道嘶吼到吐 寸飛蘭 | 2023-05-03
  • 摩根大通收购美国第一共和银行 摩根大通收购美国第一共和银行 謝飛揚 | 2023-05-02
  • 台剧赢麻了,又来一部8.9 台剧赢麻了,又来一部8.9 衛青柏 | 2023-05-02
  • 事关农村土地承包和农民权益,《农村土地承包合同管理办法》5月1日起施行 事关农村土地承包和农民权益,《农村土地承包 郟君昊 | 2023-05-02
  • 下降45分,上涨35分!34所自划线院校复试分数线涨幅汇总 下降45分,上涨35分!34所自划线院校复试分数线 袁曼雁 | 2023-05-07
  • "三高"已盯上青少年,做好这件事是关键 "三高"已盯上青少年,做好这件事是关键 習又夏 | 2023-05-05
  • 五一档没一个能打的 五一档没一个能打的 集玲琳 | 2023-05-05
  • 恐怖韩剧下神坛,这次胆小可入 恐怖韩剧下神坛,这次胆小可入 袁曼雁 | 2023-05-05
  • 这剧是不是用ChatGPT写的呀? 这剧是不是用ChatGPT写的呀? 惠惠君 | 2023-05-02
  • 200户连夜疏散,原因让人愤怒!“损失超一亿”,官方通报 200户连夜疏散,原因让人愤怒!“损失超一亿”, 袁曼雁 | 2023-05-03
  • 性骚扰惯犯,滚出娱乐圈 性骚扰惯犯,滚出娱乐圈 謝飛揚 | 2023-05-05
  • 48岁何炅自曝已老花眼,黄磊睡前认老,《向往的生活》证实将停办 48岁何炅自曝已老花眼,黄磊睡前认老,《向往的 佼昌翰 | 2023-05-02
  • 一个《长月烬明》倒了,《狐妖》《长相思》《与凤行》…在路上了 一个《长月烬明》倒了,《狐妖》《长相思》《 惠惠君 | 2023-05-02
  • 张天爱假期晒“酷”存照 卷发披肩穿黑色吊带裙大秀好身材 张天爱假期晒“酷”存照 卷发披肩穿黑色吊 嬴覓晴 | 2023-05-02
  • 当年轻人开始不随份子钱 当年轻人开始不随份子钱 袁曼雁 | 2023-05-02
  • 毕滢用8年时间成功逼宫?曾被传已婚生子的她,不容小觑 毕滢用8年时间成功逼宫?曾被传已婚生子的她, 幸聽楓 | 2023-05-03
  • 宋慧乔获视后首次晒照,拿奖杯笑容温柔 宋慧乔获视后首次晒照,拿奖杯笑容温柔 郜萌運 | 2023-05-02

©2022 大酷樂 版權所有

隱私政策 | 服務條款 | 聯繫我們