DragonZZ 2025-02-14 节省成本是因为它的MLA在架构上的优化,节省了大量内存和时间成本,英伟达跌是因为之前基本逻辑是更多的显卡更强的模型,现在deepseek直接告诉所有人不需要更多显卡,从算法去优化也能得到更强的模型,所以才导致英伟达的估值下降 ♥ 6
考神大鲁_Official 2025-02-15 多了个深度思考,但是不要过度了,因为会和部分人一样陷入死圈,所以人和大模型思考一定要适度,找不同的方法解决问题[热词系列_知识增加][热词系列_三连] ♥ 2
霖罐 2025-02-14 各路大神哪需要深扒和推算,deepseek 论文里面写了单次训练成本500多万美金对比 meta 几千万一次的训练成本的确很便宜。说成本只需要1/10这个还没得到证实,只看单次训练成本的确没错。还要算上失败 人工 算力 硬件 数据清洗各个环节才能说是成本 。 ♥ 1
哔屏蔽 2025-02-22 草,也就是说deepseek的团队甚至可以抛开cuda直接开发使用于自己的编译平台,将其适配于任何一家显卡?老黄股价暴跌怕不是主要因为这个,如果真有能绕开cuda护城河的ai应用,这谁家的显卡不都是显卡吗?
Comments
差评软件部?
♥ 19
不是,怎么国内还上得慢?[笑哭]
♥ 9 ↩ 5
没必要和他拼绝对算力,把单位性能的成本降下去才是硬道理[笑哭] 虽然说现在网站确实被挤爆了不好用[笑哭] 但也至少该让gpt和某文心一言感受一下鲶鱼效应了[吃瓜]
♥ 8
节省成本是因为它的MLA在架构上的优化,节省了大量内存和时间成本,英伟达跌是因为之前基本逻辑是更多的显卡更强的模型,现在deepseek直接告诉所有人不需要更多显卡,从算法去优化也能得到更强的模型,所以才导致英伟达的估值下降
♥ 6
没了万亿美元绝大部分人都没感觉,说明财富真的是在极少数人手里,可能全世界就几十个人在哭[doge]
♥ 3
基本上连续问3个及以上的问题,它就会“服务器繁忙,请稍后再试”,非常影响使用体验
♥ 2 ↩ 6
多了个深度思考,但是不要过度了,因为会和部分人一样陷入死圈,所以人和大模型思考一定要适度,找不同的方法解决问题[热词系列_知识增加][热词系列_三连]
♥ 2
这不算是自我迭代吧[脱单doge]
♥ 2
简而言之,chatgtp用的c,deepseek用的汇编[doge]
♥ 1
各路大神哪需要深扒和推算,deepseek 论文里面写了单次训练成本500多万美金对比 meta 几千万一次的训练成本的确很便宜。说成本只需要1/10这个还没得到证实,只看单次训练成本的确没错。还要算上失败 人工 算力 硬件 数据清洗各个环节才能说是成本 。
♥ 1
真不一样
DeepSeek没什么不一样,换汤不换药。新产品好卖课罢了,个个都在这吹,都打算卖课而已。
我有点懵,AI跟大模型是一个意思吗? 有大佬说清楚么?
↩ 4
有人发现今天播主有点帅吗[喜极而泣]
我急需真爱粉,所以我来这里获🉐科技粉,喜欢看我的科技视频就关注我,是否关注和三连由你决定。 我的代表作品BV1qj411D7Km 感谢你们的关注和三连🥺
草,也就是说deepseek的团队甚至可以抛开cuda直接开发使用于自己的编译平台,将其适配于任何一家显卡?老黄股价暴跌怕不是主要因为这个,如果真有能绕开cuda护城河的ai应用,这谁家的显卡不都是显卡吗?
[打call]