领读Kimi K3技术报告:从架构创新聊起,注意力美学、多教师蒸馏和开源MoE

合集 · 技术之美 (8)

  1. 3:20:54
    逐篇讲解DeepSeek关键9篇论文及创新点——“勇敢者的游戏”
  2. 2:36:13
    逐篇讲解DeepSeek、Kimi、MiniMax注意力机制新论文——“硬件上的暴力美学”
  3. 2:29:42
    逐篇解析机器人基座模型和VLA经典论文——“人就是最智能的VLA”
  4. 2:33:43
    人类驯服可控核聚变还有多少路程?对能量奇点创始人杨钊3小时访谈
  5. 2:38:11
    宁德时代领投11亿!和王鹤聊:具身智能学术边缘史和资本轰炸后的人为乱象
  6. 2:20:39
    逐段讲解Kimi K2报告并对照ChatGPT Agent、Qwen3-Coder等:“系统工程的胜利”
  7. 4:22:38
    干货!开源一段论文探索之旅给大家
  8. 2:04:20
    领读Kimi K3技术报告:从架构创新聊起,注意力美学、多教师蒸馏和开源MoE
Description
【论文链接】
[Microsoft] RetNet:最初的data-independent decay与chunk-recurrent递归形式(https://www.microsoft.com/en-us/research/publication/retentive-network-a-successor-to-transformer-for-large-language-models/)
[NVIDIA] Gated DeltaNet:引⼊gated delta rule(https://research.nvidia.com/publication/2025-04_gated-delta-networks-improving-mamba2-delta-rule)
[Moonshot] Kimi Linear:fine-grained decay及其带来的infra变化(https://arxiv.org/abs/2510.26692)
[Qwen] Gated Attention for Large Language Models:attention gating与训练稳定性(https://arxiv.org/abs/2505.06708)
[Microsoft] On Layer Normalization in the Transformer Architecture:Pre-LN、Post-LN与训练稳定性(https://arxiv.org/abs/2002.04745)
[ByteDance Seed] Hyper-Connections:残差连接的新维度(https://arxiv.org/abs/2409.19606)
[Moonshot] Attention Residuals:以跨深度attention取代固定残差累积,使各层选择性聚合此前表⽰(https://arxiv.org/abs/2603.15031)
[NVIDIA] LatentMoE:通过latent expert space降低MoE通信与权重访问成本(https://arxiv.org/abs/2601.18089)
[OpenAI] GPT-OSS:以clamped SwiGLU控制激活值(https://cdn.openai.com/pdf/419b6906-9da6-406c-a19d-1bb078ac7637/oai_gpt-oss_model_card.pdf)
[Moonshot] Moonlight / Muon is Scalable for LLM Training:更好的优化表现及随之突出的 activation outlier问题(https://arxiv.org/abs/2502.16982)
[科学空间] 《MoE环游记:6、最优分配促均衡》:从最优分配推导Quantile Balancing(https://kexue.fm/archives/11619)
[OpenBMB] MiniCPM:WSD的训练预算扩展、稳定阶段复⽤、继续训练与提前停⽌(https://arxiv.org/abs/2404.06395)
[Cohere] RNoPE:交替使⽤RoPE与NoPE,兼顾位置建模与长上下⽂检索(https://arxiv.org/abs/2501.18795)
[Moonshot] Kimi K1.5:提出partial rollout,通过复⽤未完成轨迹降低长CoT rollout开销(https://arxiv.org/abs/2501.12599)
[Moonshot] Kimi K2.5:reasoning-effort budget control 与 Agentic Generative Reward Model(https://arxiv.org/abs/2602.02276)
[Microsoft Research] MiniLLM:基于student-generated samples的on-policy distillation(https://arxiv.org/abs/2306.08543)
[FLA] Flash Linear Attention:KDA kernel与线性注意⼒⾼效实现(https://github.com/fla-org/flash-linear-attention)
[DeepSeek] DeepSeek-V3 Technical Report:DualPipe与细粒度MoE communication–computation overlap(https://arxiv.org/abs/2412.19437)

Comments

z_xdxm 4h ago

能不能把杨植麟叫来说啊,一年没来了怪想念的

♥ 4

坐忘道zwd 16h ago

啥时候找苏神来做一下节目[吃瓜]

♥ 19 ↩ 1

颜值笔记CuteNoteApp 20h ago

省流笔记侠总结(用CuteNote.app网站总结的)

♥ 36 ↩ 2

一凡-是你吗 20h ago

“宇涛透过领读K3技术报告也串联讲解了十多篇相关论文。他的语速非常快——前方语速预警。”吓哭了,果然,默默地把倍速调了下来

♥ 23

在线管理助手 3h ago

论文汇总 https://pan.quark.cn/s/674b49da8013

♥ 3 ↩ 1

CPFelix 21h ago

小珺的播客越来越硬了[星星眼]

♥ 7

焱焱见闻 19h ago

学不完 完全学不完 嘉宾语速是我第一个需要调低的[笑哭]

♥ 5

简-渡 20h ago

前段时间看了一下k3的报告,写的是真多呀从架构到预训练后训练到infra,四五十页的报告[笑哭][笑哭]啃了一点啃不动了

♥ 5

量子Bug 20h ago

没有字幕吗?[笑哭]

♥ 6 ↩ 2

一凡-是你吗 20h ago

真的喜欢这档节目!每期都入木三分,丰富的知识信息量每次都让我欲罢不能❤️‍🔥❤️‍🔥❤️‍🔥落座落座 开始学习,揭开K3的神秘面纱,前段时间掀起波澜的开源国模,让我看看怎么个事🫡🫡🫡

♥ 4 ↩ 1

开票助手159 1h ago

画面好评♕

赵猫画虎-步芝道 17h ago

谢谢小珺,一直通过小珺的播客来放松[doge_金箍]

♥ 3

昵称不能小于三个媳妇 15h ago

国外一开源国内就突破[大笑]

♥ 2 ↩ 14

平生光阴短不如茶酒伴 20h ago

字幕开关没开

♥ 2

sheepdad 1h ago

这速度。。。。有点确实

地平线1917 4h ago

真是超棒的珺

Ai好记总结助手 1h ago

本期播客邀请清华博士孙雨涛,深度解读Kimi K3技术报告,全面剖析了这个2.8T开源模型的架构与工程创新。 由 @考拉不会拉 召唤~

量子Bug 19h ago

这个画质怎么这么糟糕啊

♥ 1 ↩ 1

淄博超霸 17h ago

看完了,睡觉起来把不懂得查一下,美滋滋!

♥ 2