Description
【论文链接】
[Microsoft] RetNet:最初的data-independent decay与chunk-recurrent递归形式(https://www.microsoft.com/en-us/research/publication/retentive-network-a-successor-to-transformer-for-large-language-models/)
[NVIDIA] Gated DeltaNet:引⼊gated delta rule(https://research.nvidia.com/publication/2025-04_gated-delta-networks-improving-mamba2-delta-rule)
[Moonshot] Kimi Linear:fine-grained decay及其带来的infra变化(https://arxiv.org/abs/2510.26692)
[Qwen] Gated Attention for Large Language Models:attention gating与训练稳定性(https://arxiv.org/abs/2505.06708)
[Microsoft] On Layer Normalization in the Transformer Architecture:Pre-LN、Post-LN与训练稳定性(https://arxiv.org/abs/2002.04745)
[ByteDance Seed] Hyper-Connections:残差连接的新维度(https://arxiv.org/abs/2409.19606)
[Moonshot] Attention Residuals:以跨深度attention取代固定残差累积,使各层选择性聚合此前表⽰(https://arxiv.org/abs/2603.15031)
[NVIDIA] LatentMoE:通过latent expert space降低MoE通信与权重访问成本(https://arxiv.org/abs/2601.18089)
[OpenAI] GPT-OSS:以clamped SwiGLU控制激活值(https://cdn.openai.com/pdf/419b6906-9da6-406c-a19d-1bb078ac7637/oai_gpt-oss_model_card.pdf)
[Moonshot] Moonlight / Muon is Scalable for LLM Training:更好的优化表现及随之突出的 activation outlier问题(https://arxiv.org/abs/2502.16982)
[科学空间] 《MoE环游记:6、最优分配促均衡》:从最优分配推导Quantile Balancing(https://kexue.fm/archives/11619)
[OpenBMB] MiniCPM:WSD的训练预算扩展、稳定阶段复⽤、继续训练与提前停⽌(https://arxiv.org/abs/2404.06395)
[Cohere] RNoPE:交替使⽤RoPE与NoPE,兼顾位置建模与长上下⽂检索(https://arxiv.org/abs/2501.18795)
[Moonshot] Kimi K1.5:提出partial rollout,通过复⽤未完成轨迹降低长CoT rollout开销(https://arxiv.org/abs/2501.12599)
[Moonshot] Kimi K2.5:reasoning-effort budget control 与 Agentic Generative Reward Model(https://arxiv.org/abs/2602.02276)
[Microsoft Research] MiniLLM:基于student-generated samples的on-policy distillation(https://arxiv.org/abs/2306.08543)
[FLA] Flash Linear Attention:KDA kernel与线性注意⼒⾼效实现(https://github.com/fla-org/flash-linear-attention)
[DeepSeek] DeepSeek-V3 Technical Report:DualPipe与细粒度MoE communication–computation overlap(https://arxiv.org/abs/2412.19437)
Comments
能不能把杨植麟叫来说啊,一年没来了怪想念的
♥ 4
啥时候找苏神来做一下节目[吃瓜]
♥ 19 ↩ 1
省流笔记侠总结(用CuteNote.app网站总结的)
♥ 36 ↩ 2
“宇涛透过领读K3技术报告也串联讲解了十多篇相关论文。他的语速非常快——前方语速预警。”吓哭了,果然,默默地把倍速调了下来
♥ 23
论文汇总 https://pan.quark.cn/s/674b49da8013
♥ 3 ↩ 1
小珺的播客越来越硬了[星星眼]
♥ 7
学不完 完全学不完 嘉宾语速是我第一个需要调低的[笑哭]
♥ 5
前段时间看了一下k3的报告,写的是真多呀从架构到预训练后训练到infra,四五十页的报告[笑哭][笑哭]啃了一点啃不动了
♥ 5
没有字幕吗?[笑哭]
♥ 6 ↩ 2
真的喜欢这档节目!每期都入木三分,丰富的知识信息量每次都让我欲罢不能❤️🔥❤️🔥❤️🔥落座落座 开始学习,揭开K3的神秘面纱,前段时间掀起波澜的开源国模,让我看看怎么个事🫡🫡🫡
♥ 4 ↩ 1
画面好评♕
谢谢小珺,一直通过小珺的播客来放松[doge_金箍]
♥ 3
国外一开源国内就突破[大笑]
♥ 2 ↩ 14
字幕开关没开
♥ 2
这速度。。。。有点确实
真是超棒的珺
本期播客邀请清华博士孙雨涛,深度解读Kimi K3技术报告,全面剖析了这个2.8T开源模型的架构与工程创新。 由 @考拉不会拉 召唤~
这个画质怎么这么糟糕啊
♥ 1 ↩ 1
看完了,睡觉起来把不懂得查一下,美滋滋!
♥ 2