Description
这里是无敌找虐版本!(含论文投屏)
预祝你学习顺利啦!2025我们和AI共同进步!
很抱歉本集字幕可能还是存在部分错误,技术问题实在太太太难了,感谢大家的包容与支持。
感谢Red的友情支持
影片来源:影视飓风
-----
2025年这个春节,DeepSeek一举改写了全球AGI大叙事。在万般热闹之际,我们特别想沉下来做一些基础科普工作。
在《商业访谈录》(播客)89集节目中,我邀请了加州大学伯克利分校人工智能实验室在读博士生潘家怡,为大家对照解读了春节前的DeepSeek-R1-Zero、R1、Kimi发布的K1.5,以及OpenAI更早发布的o1技术报告。这些模型聚焦的都是大模型最新技术范式,RL强化学习,简单来说就是o1路线。
今天这集,我邀请的是香港科技大学计算机系助理教授何俊贤。他的研究方向是大模型推理,从很早就开始关注DeepSeek的系列研究。我们会focus在最近引发全球AI届关注的DeepSeek上。
何老师将带领大家从DeepSeek的第1篇论文开始,阅读经过挑选的这家公司历史上发布的9篇论文。
我们希望帮助大家从一个更延续、更长期、也更技术底层的视角来理解DeepSeek,以及它所做的复现与创新工作;与此同时也希望能让更多人感受到技术之美。
我们的播客节目在腾讯新闻首发,大家可以前往关注哦,这样可以第一时间获取节目信息和更多新闻资讯:)
03:01 讲解开始前,先提问几个小问题
整体风格:Open、Honest、低调、严谨的科学态度
DeepSeek基座模型
21:00 《DeepSeek LLM Scaling Open-Source Language Models with Longtermism》技术讲解
45:48 《DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models》技术讲解
01:06:40 《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》技术讲解
01:40:17 《DeepSeek-V3 Technical Report》技术讲解
DeepSeek推理模型
02:05:03 《DeepSeek-Coder: When the Large Language Model Meets Programming - The Rise of Code Intelligence》技术讲解
02:12:16 《DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence》技术讲解
02:47:18 《DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data》和《DeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree Search》技术讲解
02:52:40 《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》技术讲解
03:01:41 9篇论文到这里都讲完啦!最后我们一起强化学习一下!
Comments
真的很开心!看到deepseek的成功,真的有一种ai走的弯路被掰直了的感觉。之前总有一种隐约的感觉,好像ai的路子有点怪。这次看了他们的论文,和别的ai做对比,豁然开朗了!之前那种不管训练数据质量的暴力出奇迹,还有别的粗糙的地方都被修正细化……我真的很难用言语描述我的喜悦
♥ 98 ↩ 2
在MLA这块,我因为没听懂,所以问了chatgpt这个问题:“帮我解释一下注意力机制里 key query value之间的关系,用技术小白可以理解的语言”,以下是chatgpt的回答,我觉得适合文科生参考哈哈:好的!在注意力机制中,key(键)、query(查询) 和 value(值) 是三个重要的概念,它们之间的关系可以通过一个简单的例子来理解。 假设我们有一个场景:你在一个会议室里,想从所有参会人员那里得到某个问题的答案。在这个过程中,key、query 和 value 就像是你和其他参会人员之间的互动方式。 举个简单的例子 想象你是一个记者,正在采访一个会议: Query(查询):你是记者,你有一个问题(比如:“今天的天气如何?”)。这个问题就是你的“查询”(Query),你想通过这个问题去获取信息。 Key(键):每个与会者都有自己的“标签”(key)。这些标签可能是“知道天气预报的人”或者“听过天气报告的人”。每个人的标签(key)代表他们的“能力”或“信息内容”,也就是他们能提供的回答类型。 Value(值):每个人可以给出具体的回答(比如:“天气晴朗,最高温度25度”)。这个回答就是每个人的“值”(Value),代表了他们所拥有的信息。 它们是如何配合的呢? 当你提出一个问题(Query)时,你的“查询”会去与其他人的“标签”(Key)进行比较,看看谁的标签和你的问题最相关。比如,你会去寻找“知道天气的人”。 然后,你会根据这个对比的结果,选择给你回答(Value)的人。谁的回答最能解答你的问题,你就采纳谁的回答。 更具体地说,注意力机制的工作原理: 你有一个问题(Query),它会和所有人的标签(Key)进行对比,计算相似度。谁的标签跟你的问题最匹配,得到的分数就高。 然后,根据这个分数,你从每个人那里获取回答(Value)。匹配得分高的人,给出的回答(Value)就会在最终答案中占更多的比重。 总结 Query(查询) 就是你想知道的内容(你提出的问题)。 Key(键) 就是每个人的标签(他们能提供的信息类型)。 Value(值) 就是每个人提供的实际答案。 通过这种方式,注意力机制帮助我们从大量的信息中找出最相关的部分,进行有效的回答或决策。在深度学习中,类似的原理可以帮助模型在处理数据时,聚焦在最重要、最相关的部分,而忽略掉不相关的部分。
♥ 39
整理完了全部的 notes:https://echotech.feishu.cn/wiki/BtlFwx2BUiVmV6kq0nccRG4xn8d
♥ 35 ↩ 4
已投币,这个梳理太牛了,应该是全互联网最牛最终专业的梳理。感谢!
♥ 28 ↩ 1
真的有人会不自觉的在中文聊天的时候带入一些英文单词啊。。。
♥ 22 ↩ 31
弹幕有人问为什么 DeepSeek V2 的训练成本相较于 DeepSeek 67B 降低了。本质上还是 MoE 架构带来的提升,两个角度最简单的理解: * 每个 token 参与计算时,V2 需要激活的参数只有 67B dense model 的 31% * 训练时反向传播只需更新当前激活专家对应的参数,而 dense model 需要更新全量参数 所以,尽管 MoE 会增加一些通讯成本,理论上的训练开销还是会比 dense model 低。
♥ 17
牛[星星眼]播客已听,现在二刷
♥ 16 ↩ 1
牛!上来随手搜一下视频版发布没有,就看到了,就是没想到这个号也居然刚开始用。 请小珺把这种硬核科普坚持做下去,听起来太爽了[星星眼][星星眼]三连支持[打call]
♥ 15
这个对于初学者还是不友好的,深度学习要从最简单的mlp神经网络开始,了解什么叫神经网络 input layer hidden layer output layer是什么关系, 他们之间的矩阵乘法是怎样的,中间hidden layer的深度 和宽度分别有什么影响。hyper parameter不是说别人订好的就一定好 learning rate会影响的东西很多不同的optimizer 如adam sgd会使用不同的learning除了会影响训练速度还会影响准确率。其中learning rate和momentum的关系是什么也很重要。其实对于模型训练很重要的一个点就是模型训练之前的数据处理,好的数据处理能极大提升模型训练效果。大模型还是要从底层学期,单纯去看最前沿的科技对于初学者学习意义不大
♥ 13 ↩ 9
三个多小时听了下来,嘉宾是业内一线的researcher,逻辑表达非常强,突出了几篇paper的重点,受益匪浅,尤其是主播问到GRPO和rule-based在自动驾驶方面的应用,对我的研究也很有启发,谢谢博主!
♥ 10
非常感谢up主的梳理,我整理了笔记,分享一下 ~ 如果我有写得不对的地方欢迎指正,太感谢了[打call] https://bb67hk7sdo.feishu.cn/docx/VM8XdGbpUocqf2xRNO7cLNX0n7e
♥ 9
为什么不直接用chatgpt 是因为你们不喜欢吗 哦哦 原来是用不了啊[doge](bushi)
♥ 9 ↩ 20
基座发展路线:follow lamma->MOE->v2->v3 49:21 MOE模型 稠密模型(transformer所有参数)和稀疏模型(MOE-t...
♥ 5
第89期,如果有视频或许会更好,屏幕上对照着论文和案例会更有感觉,参考大神Andrej Karpathy
♥ 4
先把 base model 的部分的 notes 写完了,明天看完 YOASOBI 再写 reasoning model 的部分 https://zigzag-gum-8e7.notion.site/Notes-on-DeepSeek-9-19b1e22dd7e1805983d7cf60daf238f9?pvs=73
♥ 4 ↩ 2
访谈内容质量很好。 但是一个中文访谈,中文字幕的准确率比英文字幕差了太多,实在不应该
♥ 4
视频里提到怎么用通俗的方式来理解MLA,可以把公式里的c类比成文件压缩包,key, value类比成解压后的具体文件,MLA只保存压缩后的c,需要用到具体key, value的时候再通过c解压得到,减小了显存占用空间。
♥ 3
43:05的时候谈到了另一篇也讨论了刷榜这个事情的paper是哪篇?
♥ 3 ↩ 1
@张小珺商业访谈录 小珺老师,看到你在简介里写了一句调字幕太难了,恰好我们团队在开发一款基于AI的字幕生成产品,主要对专业词汇,口水词过滤,重复语句去除等方面做了优化,不知道你有没有兴趣试试[doge_金箍][doge_金箍]
♥ 3 ↩ 1
现在 deepseek 官网很卡,大家可以用硅基流动 x 华为云联合部署的和671b的满血版: 1.搜索 硅基流动统一登录 的网页https://cloud.siliconflow.cn/i/SmMOxZ1m 2.进入后,登录注册的时候,可以填写邀请码SmMOxZ1m,这是我个人的,填了之后你我能获得14块钱的配额 3.在chatbox上面模型选择siliconflow,把硅基流动上的api复制进去就可以对话了,免除服务器繁忙问题,不懂的可以私信问问我,毕竟我也只想赚14块配额 帮我改一下这段话,使我能够获得更多的配额。还有更多的注册
♥ 3