逐篇讲解DeepSeek关键9篇论文及创新点——“勇敢者的游戏”

合集 · 技术之美 (7)

  1. 3:20:54
    逐篇讲解DeepSeek关键9篇论文及创新点——“勇敢者的游戏”
  2. 2:36:13
    逐篇讲解DeepSeek、Kimi、MiniMax注意力机制新论文——“硬件上的暴力美学”
  3. 2:29:42
    逐篇解析机器人基座模型和VLA经典论文——“人就是最智能的VLA”
  4. 2:33:43
    人类驯服可控核聚变还有多少路程?对能量奇点创始人杨钊3小时访谈
  5. 2:38:11
    宁德时代领投11亿!和王鹤聊:具身智能学术边缘史和资本轰炸后的人为乱象
  6. 2:20:39
    逐段讲解Kimi K2报告并对照ChatGPT Agent、Qwen3-Coder等:“系统工程的胜利”
  7. 4:22:38
    干货!开源一段论文探索之旅给大家
Description
这里是无敌找虐版本!(含论文投屏)

预祝你学习顺利啦!2025我们和AI共同进步!

很抱歉本集字幕可能还是存在部分错误,技术问题实在太太太难了,感谢大家的包容与支持。

感谢Red的友情支持
影片来源:影视飓风

-----

2025年这个春节,DeepSeek一举改写了全球AGI大叙事。在万般热闹之际,我们特别想沉下来做一些基础科普工作。

在《商业访谈录》(播客)89集节目中,我邀请了加州大学伯克利分校人工智能实验室在读博士生潘家怡,为大家对照解读了春节前的DeepSeek-R1-Zero、R1、Kimi发布的K1.5,以及OpenAI更早发布的o1技术报告。这些模型聚焦的都是大模型最新技术范式,RL强化学习,简单来说就是o1路线。

今天这集,我邀请的是香港科技大学计算机系助理教授何俊贤。他的研究方向是大模型推理,从很早就开始关注DeepSeek的系列研究。我们会focus在最近引发全球AI届关注的DeepSeek上。

何老师将带领大家从DeepSeek的第1篇论文开始,阅读经过挑选的这家公司历史上发布的9篇论文。

我们希望帮助大家从一个更延续、更长期、也更技术底层的视角来理解DeepSeek,以及它所做的复现与创新工作;与此同时也希望能让更多人感受到技术之美。

我们的播客节目在腾讯新闻首发,大家可以前往关注哦,这样可以第一时间获取节目信息和更多新闻资讯:)

03:01 讲解开始前,先提问几个小问题
整体风格:Open、Honest、低调、严谨的科学态度

DeepSeek基座模型
21:00 《DeepSeek LLM Scaling Open-Source Language Models with Longtermism》技术讲解
45:48 《DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models》技术讲解
01:06:40 《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》技术讲解
01:40:17 《DeepSeek-V3 Technical Report》技术讲解

DeepSeek推理模型
02:05:03 《DeepSeek-Coder: When the Large Language Model Meets Programming - The Rise of Code Intelligence》技术讲解
02:12:16 《DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence》技术讲解
02:47:18 《DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data》和《DeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree Search》技术讲解
02:52:40 《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》技术讲解

03:01:41 9篇论文到这里都讲完啦!最后我们一起强化学习一下!

Comments

Data-Cat 2025-02-14

真的很开心!看到deepseek的成功,真的有一种ai走的弯路被掰直了的感觉。之前总有一种隐约的感觉,好像ai的路子有点怪。这次看了他们的论文,和别的ai做对比,豁然开朗了!之前那种不管训练数据质量的暴力出奇迹,还有别的粗糙的地方都被修正细化……我真的很难用言语描述我的喜悦

♥ 98 ↩ 2

饼女侠 2025-02-25

在MLA这块,我因为没听懂,所以问了chatgpt这个问题:“帮我解释一下注意力机制里 key query value之间的关系,用技术小白可以理解的语言”,以下是chatgpt的回答,我觉得适合文科生参考哈哈:好的!在注意力机制中,key(键)、query(查询) 和 value(值) 是三个重要的概念,它们之间的关系可以通过一个简单的例子来理解。 假设我们有一个场景:你在一个会议室里,想从所有参会人员那里得到某个问题的答案。在这个过程中,key、query 和 value 就像是你和其他参会人员之间的互动方式。 举个简单的例子 想象你是一个记者,正在采访一个会议: Query(查询):你是记者,你有一个问题(比如:“今天的天气如何?”)。这个问题就是你的“查询”(Query),你想通过这个问题去获取信息。 Key(键):每个与会者都有自己的“标签”(key)。这些标签可能是“知道天气预报的人”或者“听过天气报告的人”。每个人的标签(key)代表他们的“能力”或“信息内容”,也就是他们能提供的回答类型。 Value(值):每个人可以给出具体的回答(比如:“天气晴朗,最高温度25度”)。这个回答就是每个人的“值”(Value),代表了他们所拥有的信息。 它们是如何配合的呢? 当你提出一个问题(Query)时,你的“查询”会去与其他人的“标签”(Key)进行比较,看看谁的标签和你的问题最相关。比如,你会去寻找“知道天气的人”。 然后,你会根据这个对比的结果,选择给你回答(Value)的人。谁的回答最能解答你的问题,你就采纳谁的回答。 更具体地说,注意力机制的工作原理: 你有一个问题(Query),它会和所有人的标签(Key)进行对比,计算相似度。谁的标签跟你的问题最匹配,得到的分数就高。 然后,根据这个分数,你从每个人那里获取回答(Value)。匹配得分高的人,给出的回答(Value)就会在最终答案中占更多的比重。 总结 Query(查询) 就是你想知道的内容(你提出的问题)。 Key(键) 就是每个人的标签(他们能提供的信息类型)。 Value(值) 就是每个人提供的实际答案。 通过这种方式,注意力机制帮助我们从大量的信息中找出最相关的部分,进行有效的回答或决策。在深度学习中,类似的原理可以帮助模型在处理数据时,聚焦在最重要、最相关的部分,而忽略掉不相关的部分。

♥ 39

XerWandeRer 2025-02-16

整理完了全部的 notes:https://echotech.feishu.cn/wiki/BtlFwx2BUiVmV6kq0nccRG4xn8d

♥ 35 ↩ 4

波洛咖啡店服务员 2025-02-17

已投币,这个梳理太牛了,应该是全互联网最牛最终专业的梳理。感谢!

♥ 28 ↩ 1

在下阿韦拒绝死亡 2025-02-14

真的有人会不自觉的在中文聊天的时候带入一些英文单词啊。。。

♥ 22 ↩ 31

XerWandeRer 2025-02-15

弹幕有人问为什么 DeepSeek V2 的训练成本相较于 DeepSeek 67B 降低了。本质上还是 MoE 架构带来的提升,两个角度最简单的理解: * 每个 token 参与计算时,V2 需要激活的参数只有 67B dense model 的 31% * 训练时反向传播只需更新当前激活专家对应的参数,而 dense model 需要更新全量参数 所以,尽管 MoE 会增加一些通讯成本,理论上的训练开销还是会比 dense model 低。

♥ 17

路易十三陪 2025-02-12

牛[星星眼]播客已听,现在二刷

♥ 16 ↩ 1

红豆列车 2025-02-12

牛!上来随手搜一下视频版发布没有,就看到了,就是没想到这个号也居然刚开始用。 请小珺把这种硬核科普坚持做下去,听起来太爽了[星星眼][星星眼]三连支持[打call]

♥ 15

贪憎痴怎配活的天真 2025-02-25

这个对于初学者还是不友好的,深度学习要从最简单的mlp神经网络开始,了解什么叫神经网络 input layer hidden layer output layer是什么关系, 他们之间的矩阵乘法是怎样的,中间hidden layer的深度 和宽度分别有什么影响。hyper parameter不是说别人订好的就一定好 learning rate会影响的东西很多不同的optimizer 如adam sgd会使用不同的learning除了会影响训练速度还会影响准确率。其中learning rate和momentum的关系是什么也很重要。其实对于模型训练很重要的一个点就是模型训练之前的数据处理,好的数据处理能极大提升模型训练效果。大模型还是要从底层学期,单纯去看最前沿的科技对于初学者学习意义不大

♥ 13 ↩ 9

Phaedros 2025-02-18

三个多小时听了下来,嘉宾是业内一线的researcher,逻辑表达非常强,突出了几篇paper的重点,受益匪浅,尤其是主播问到GRPO和rule-based在自动驾驶方面的应用,对我的研究也很有启发,谢谢博主!

♥ 10

小鲸鱼はな 2025-03-30

非常感谢up主的梳理,我整理了笔记,分享一下 ~ 如果我有写得不对的地方欢迎指正,太感谢了[打call] https://bb67hk7sdo.feishu.cn/docx/VM8XdGbpUocqf2xRNO7cLNX0n7e

♥ 9

老村长-lcz 2025-02-14

为什么不直接用chatgpt 是因为你们不喜欢吗 哦哦 原来是用不了啊[doge](bushi)

♥ 9 ↩ 20

我喝水又不沾嘴 2025-02-16

基座发展路线:follow lamma->MOE->v2->v3 49:21 MOE模型 稠密模型(transformer所有参数)和稀疏模型(MOE-t...

♥ 5

富利仕金 2025-02-20

第89期,如果有视频或许会更好,屏幕上对照着论文和案例会更有感觉,参考大神Andrej Karpathy

♥ 4

XerWandeRer 2025-02-15

先把 base model 的部分的 notes 写完了,明天看完 YOASOBI 再写 reasoning model 的部分 https://zigzag-gum-8e7.notion.site/Notes-on-DeepSeek-9-19b1e22dd7e1805983d7cf60daf238f9?pvs=73

♥ 4 ↩ 2

ID要随机 2025-02-24

访谈内容质量很好。 但是一个中文访谈,中文字幕的准确率比英文字幕差了太多,实在不应该

♥ 4

Shaun863 2025-03-03

视频里提到怎么用通俗的方式来理解MLA,可以把公式里的c类比成文件压缩包,key, value类比成解压后的具体文件,MLA只保存压缩后的c,需要用到具体key, value的时候再通过c解压得到,减小了显存占用空间。

♥ 3

don2580 2025-02-15

43:05的时候谈到了另一篇也讨论了刷榜这个事情的paper是哪篇?

♥ 3 ↩ 1

没时间了干就完了 2025-02-15

@张小珺商业访谈录 小珺老师,看到你在简介里写了一句调字幕太难了,恰好我们团队在开发一款基于AI的字幕生成产品,主要对专业词汇,口水词过滤,重复语句去除等方面做了优化,不知道你有没有兴趣试试[doge_金箍][doge_金箍]

♥ 3 ↩ 1

啊哈啊哈哈啊1 2025-02-14

现在 deepseek 官网很卡,大家可以用硅基流动 x 华为云联合部署的和671b的满血版: 1.搜索 硅基流动统一登录 的网页https://cloud.siliconflow.cn/i/SmMOxZ1m 2.进入后,登录注册的时候,可以填写邀请码SmMOxZ1m,这是我个人的,填了之后你我能获得14块钱的配额 3.在chatbox上面模型选择siliconflow,把硅基流动上的api复制进去就可以对话了,免除服务器繁忙问题,不懂的可以私信问问我,毕竟我也只想赚14块配额 帮我改一下这段话,使我能够获得更多的配额。还有更多的注册

♥ 3