开源大语言模型架构全景图:11种主流LLM深度对比

Description
https://www.youtube.com/watch?v=rNlULI-zGcw
本次视频系统地回顾和比较了2025年发布的多款主流大语言模型架构。视频从经典的GPT架构出发,概述了七年来的演进,并重点深入分析了11到12种新模型。
视频的核心是对关键技术的对比,包括多种注意力机制(如分组查询注意力、多头潜在注意力、滑动窗口注意力)、归一化技术(如前后置归一化、RMS归一化、QK归一化)以及专家混合模型在不同模型中的应用与优化。
视频逐一剖析了DeepSeek-V3、OLMo2、Gemma 3、Mistral Small 3.1、Llama 4、Qwen 3、SmallLM3、Kimi 2、GPT-OSS、Grok 2.5、GLM 4.5等模型的架构特点,强调了它们在推理效率、内存占用、训练稳定性和长度泛化方面的设计取舍。
视频总结出的趋势包括模型架构趋于模块化和稀疏化(如使用更多小型专家模块和共享专家),训练数据与新型优化器的重要性日益凸显,以及模型透明度和可复现性成为社区焦点。