架构大突破,DeepSeek-V3.2重磅发布!成本暴降50%!原论文解读+模型特性介绍+DeepSeek稀疏注意力原理介绍!
Description
架构大突破,DeepSeek-V3.2成本暴降50%!原论文解读+模型特性+DeepSeek稀疏注意力原理介绍! ✅置顶评论扫码加入【赋范大模型技术社区】,领【本视频完整资料】,以及更多【DeepSeek智能体Agent开发硬核教程】+无门槛技术交流,期待你的加入!
架构大突破,DeepSeek-V3.2成本暴降50%!原论文解读+模型特性+DeepSeek稀疏注意力原理介绍! ✅置顶评论扫码加入【赋范大模型技术社区】,领【本视频完整资料】,以及更多【DeepSeek智能体Agent开发硬核教程】+无门槛技术交流,期待你的加入!
Comments
用过qwen-next的速度已经回不去普通大模型了[笑哭]
♥ 242 ↩ 34
这个是真便宜,百万输出3块[笑哭]
♥ 201 ↩ 14
为啥我感觉up的着装像是神职人员,正在布道的感觉[笑哭]
♥ 97 ↩ 5
不知道为什么deepseek刚出的时候感觉挺牛的,但是最近越用越奇怪[笑哭]
♥ 62 ↩ 44
DSA来了[doge] 估计3.2GA至少能到200K上下文了 价格还大跳水 爽,还得是牢梁[tv_点赞]
♥ 55 ↩ 21
的确有所提升,以前元宵节的时候我问Deepseek 今天是什么节日,他跟我说今天不是节日[藏狐] ,我反驳了他,他才去深度思考才回答今天是什么节日,然后介绍。刚刚我再问它,今天是什么纪念日,它直接回答是烈士纪念日,比之前思考的更好了[OK] 。今天的纪念日也就华为日历告诉我,跟我科普今天。我的苹果日历没有任何。中国人还是得要用中国自己的东西,洋人输出是洋人的文化,我们自己的文化还得要我们自己来宣传,比如手机
♥ 53 ↩ 13
哎, Dsa稀疏注意力机制能不能再叠加一个qwen3next的上面的线性注意力(脑洞时间)
♥ 44 ↩ 7
希望这只是前菜
♥ 44 ↩ 4
对不起,我无法回答这个问题
♥ 38 ↩ 1
就酒馆的使用体验来说ds进步巨大,我感觉比目前的哈基米好用,有人说限制词,我只能说还是先分清大模型和app吧
♥ 36 ↩ 35
限制词还会很多吗
♥ 28 ↩ 23
九天老师还是这么快[星星眼]那什么,想知道这个效果好的话,是不是ai的记忆力以后就有救了?
♥ 27 ↩ 5
我在Deepseek官网倒是没啥次数提示,在问小白用几次就要收费,为啥啊?[doge]
♥ 19 ↩ 8
变笨了,deepseek,而且超级敏感,我只想问一下语文题啊,我都要自己把敏感人物换成a和b。
♥ 18 ↩ 3
这API价格就很他妈香
♥ 18 ↩ 15
突破就是我充的50块钱能用到几年后了
♥ 17
便宜拿来翻译游戏真好,之前用这个翻译一部就3块钱,晚上
♥ 14 ↩ 2
deepseek要钱?为什么我用的一直免费
♥ 13 ↩ 12
但是还是不如国外的啊[笑哭]
♥ 10 ↩ 20