最强开源大模型Llama-4深度介绍!模型特性剖析&DeepSeek性能比较,详解模型部署硬件要求与训练流程!
Description
最强开源大模型Llama-4正式发布!深度剖析模型特性&DeepSeek性能比较,详解模型部署硬件要求与训练流程! ✅置顶评论扫码加入【赋范大模型技术社区】,领最新【Llama 4部署调用与微调教程】,以及更多【海量硬核独家技术干货】内容+无门槛技术交流,期待你的加入!
最强开源大模型Llama-4正式发布!深度剖析模型特性&DeepSeek性能比较,详解模型部署硬件要求与训练流程! ✅置顶评论扫码加入【赋范大模型技术社区】,领最新【Llama 4部署调用与微调教程】,以及更多【海量硬核独家技术干货】内容+无门槛技术交流,期待你的加入!
Comments
【Llama-4存在跑分作弊嫌疑】根据我们近一段时间的测试,Llama-4两款模型的实际使用性能远达不到大模型竞技场1400分数水平,实际测试结果Llama-4-Mevarick模型性能和DeepSeek V2.5接近。Meta官方解释是大模型竞技场版的Llama-4是“竞技场特供版”,该版本模型并未开源,也就是说官方给出的说明实际上是“竞技场特供版”模型介绍,因此本视频亦然。目前尚不明确Mate为何要砸Llama模型这个金字招牌,为不影响大家对模型性能的判断,我将在之后删除本视频,并取消后续Llama-4公开课更新计划。更多其他高价值学习资料,欢迎大家加入大模型技术社区免费学习哦~
♥ 29 ↩ 3
统一回答下大家关心的几个问题: 1.模型参数,Llama-4是混合专家模型,比如Llama-4-Scout-17B-16E,代表的含义不是这个模型是17B,而是每个激活的专家是17B,模型总参数是109B; 2.模型中文性能,历代Llama模型都存在中文词表太小的问题,这就好比某种语言词汇量比较小,所以往往需要进行微调并修改词表,才能完全激活模型的中文能力,此前Llama1-3代模型都是这么过来的,要用Llama模型先进行中文能力微调[笑哭]
♥ 26
中文能力在qwen2.5-72B和DeepSeekV3之间
♥ 5 ↩ 2
跟住九天就是跟住大模型前沿[支持]
♥ 3 ↩ 1
期待R2赶紧发布,把场子找回来
♥ 3 ↩ 4
这也太迅速了
♥ 2
真能达到排行榜上的水平么?比gpt4o都强,这么玩,gpt就难受了,都不如人家开源的[doge]
♥ 2 ↩ 6
Llama-4排名都是30多名去,是个仓促版还没学到精髓,只能和DeepSeek V2.5去对比。[墨镜]
♥ 1 ↩ 1
只有OpenAI受伤的世界达成了
♥ 1 ↩ 3
他们员工都反馈模型跑分作假,不愿意在论文上署名[笑哭]
最大参数, 最强就算了[吃瓜]
请问一下老师vllm可以用来推理多模态大模型嘛?也想问一下你们是用什么工具来推理的?
↩ 1
博主直播吗?在哪个平台直播?了解的,具体说一下,可以吗?
↩ 1
不支持中文吗?
↩ 3
问题来了,怎么用上
太快了[笑哭]
6