逐篇讲解DeepSeek、Kimi、MiniMax注意力机制新论文——“硬件上的暴力美学”

合集 · 技术之美 (7)

  1. 3:20:54
    逐篇讲解DeepSeek关键9篇论文及创新点——“勇敢者的游戏”
  2. 2:36:13
    逐篇讲解DeepSeek、Kimi、MiniMax注意力机制新论文——“硬件上的暴力美学”
  3. 2:29:42
    逐篇解析机器人基座模型和VLA经典论文——“人就是最智能的VLA”
  4. 2:33:43
    人类驯服可控核聚变还有多少路程?对能量奇点创始人杨钊3小时访谈
  5. 2:38:11
    宁德时代领投11亿!和王鹤聊:具身智能学术边缘史和资本轰炸后的人为乱象
  6. 2:20:39
    逐段讲解Kimi K2报告并对照ChatGPT Agent、Qwen3-Coder等:“系统工程的胜利”
  7. 4:22:38
    干货!开源一段论文探索之旅给大家
Description
长篇技术科普超级无敌找虐版本又来啦!
(含论文投屏)

希望和你一起感受技术之美!2025我们和AI共同进步!

------

今天这集节目延续我们的论文系列。我邀请MIT计算机科学与人工智能实验室的在读博士松琳,来给大家解读上个星期DeepSeek和Kimi发布的全新技术报告。

DeepSeek和Kimi又一次技术对垒。在同一天发布论文,两篇集中在改进注意力机制以处理长文本任务上。而春节前,MiniMax也发布了一篇注意力机制相关的论文。

松琳将带领大家阅读这3篇注意力机制有关的文章,解析不同模型公司的技术哲学和路线选择。

我们希望能让更多人领略AI技术平权,体验技术之美。

我们的播客节目在腾讯新闻首发,大家可以前往关注哦,这样可以第一时间获取节目信息和更多新闻资讯:)

02:30 讲解开始前,先提问几个小问题

15:36 DeepSeek最新论文《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》讲解
论文中文名:《原生稀疏注意力:硬件对齐且原生可训练的稀疏注意力》
路线:稀疏注意力机制
本篇工作最大亮点:Native Sparse Attention 全线压制 Full Attention

01:19:14 Kimi最新论文《MoBA: Mixture of Block Attention for Long-Context LLMs》讲解
论文中文名:《MoBA:面向长文本上下文的块注意力混合架构》
路线:稀疏注意力机制

01:44:42 MiniMax春节前的论文《MiniMax-01: Scaling Foundation Models with Lightning Attention》讲解
论文中文名:《MiniMax-01:利用闪电注意力扩展基础模型》
路线:线性注意力机制

02:30:07 最后强化学习一下

往期【技术之美】系列:
逐句讲解DeepSeek-R1、Kimi K1.5、OpenAI o1技术报告——“最优美的算法最干净”
逐篇讲解DeepSeek关键9篇论文及创新点——“勇敢者的游戏”

【更多信息】
影片来源:影视飓风

Comments

Elixir-Rorschach 2025-02-24

太棒啦姐,作为ai方向的在读博士生,听了非常受用[打call][打call][打call]

♥ 52 ↩ 2

bigbossjiang 2025-02-25

论文中文名不重要,arxiv 链接比较重要[笑哭] - DeepSeek 《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》 https://arxiv.org/pdf/2502.11089 - Kimi 《MoBA: Mixture of Block Attention for Long-Context LLMs》 https://arxiv.org/pdf/2502.13189 - MiniMax 《MiniMax-01: Scaling Foundation Models with Lightning Attention》 https://arxiv.org/pdf/2501.08313

♥ 40

白羽小苏芳 2025-02-24

给sonta小姐姐打call[星星眼][星星眼][星星眼]

♥ 29 ↩ 2

派蒙这么可爱真是抱歉 2025-02-24

AI领域新闻第一人大伙没意见吧,腾讯科技新闻板块的招牌,这不比国内特供三大水刊新智元,机器之心和量子位强?[汤圆]

♥ 26

静mo默 2025-02-25

20250225,我感觉kimi变傻了很多。。。。之前一直用kimi工作,最近已经换deepseek和豆包或跃问了。。

♥ 15

富利仕金 2025-02-24

好啊,就应该同步发视频,对照论文才更有感觉

♥ 7

Mars-tin 2025-02-28

支持sonta

♥ 5

BellaKKira 2025-02-24

太好了,是sonta,我们有救了[嘉然_暗中观察]

♥ 5 ↩ 2

今天的饭能吃吗 2025-09-15

看完了sonta讲线性模型和稀疏模型的视频。sonta的理解非常适合给初入这个领域的人当有high level roadmap,宝藏博主

♥ 4

yzqlambda 2025-02-24

@跟李沐学AI [吃瓜]

♥ 4

人工数码智能体 2025-03-03

非专业想听都没法听,全是专业词没有字幕也没法查专业词的意思

♥ 4

HL_IE 2025-02-27

作为非科班听众,感觉何俊贤那一期是大致能听懂的,这一期门槛有点高。。。[藏狐]

♥ 4

weiweijiuzaizhe 2025-02-26

非常好,传播知识,造福人类

♥ 2

不过如此996 2025-02-24

好早哦

♥ 2

zm少年123 2025-08-22

讲的挺好的,但是可能确实要先看一遍论文再听她讲会好一点。她讲的更多是她理解上的东西

♥ 1

zm少年123 2025-08-22

讲的挺好的,但是可能确实要先看一遍论文再听她讲会好一点。她讲的更多是她理解上的东西

♥ 1

波洛咖啡店服务员 2025-03-12

讲论文的话,这种有视频的版本要清楚很对。潘博士那期只有音频,就要抽象一些。希望以后讲论文的期都能有视频。 感谢up主提供这么好的采访。继续一键三连。

♥ 1

Oracle17 2025-02-24

太好了,要小珺,我们有救了

♥ 1

Diane小山 2025-02-25

姐,你是我的神!

♥ 1

imagine溟 2025-02-24

[打call]sonta

♥ 1 ↩ 1