主要是现在开源模型全是大号玩具,能满足复杂需求的开源少之又少,像稍微有点实用性的deepseek v3/r1,总计680b的参数,就算是fp4精度的也需要400g左右的显存才能跑爽,这还不算上下文要占用的显存,如果要追求非常满意的效果,至少需要fp8精度,这样的话需要的显存就是一个天文数字了,所以说真正有ai需求的还是用api吧,真正好用的御三家(gpt claude gemini)全是闭源的,就算是开源的deepseek,想用到fp8精度的也得需要买api。除非有朝一日claude能把自己的模型开源了(据说claude3.5仅不到200b),这种机器才能发挥作用
Comments
这玩意玩游戏的嫌它贵,跑AI的嫌它慢,就两个字“尴尬”
♥ 439 ↩ 25
玩概念?显存不就是更快的内存吗?[笑哭]
♥ 155 ↩ 12
你这不搞笑吗 拿内存跑 性能也比不上显存啊,而且还没有CUDA,微调训练都不行。纯粹只能本地运行推理
♥ 152 ↩ 52
395平台本地部署ai的优势就是便宜[doge]。目前来看cpu统一内存跑大模型速度差不多8t/s。这个速度只能说刚到能用的及格线。后续架构优化差不多能摸到12t/s。 对比4090 24/48g这种动辄20多t/s的速度差距确实很大。但是你架不住爆显存啊,显存爆了之后吃共享内存速度能摸到3t/s。这对比下来差距就大了。
♥ 142 ↩ 2
数据都没有,开具一张图剩下全靠编
♥ 69 ↩ 1
实际上超大显存可不仅是跑高参数量模型那么简单 我只说一点 每多1k上下文支持大约需要1g显存,想让ai一次性读懂个3万字文件,除了大模型本身有这个实力外,还得有30g额外显存支持(这还没算参数量本身的显存需求)
♥ 55 ↩ 9
孩子们,9070xt到祸第一天连掉两次驱动,望周知。
♥ 52 ↩ 53
部署70B模型每秒多少token你是一点不说!是太慢了吧?[吃瓜]
♥ 25 ↩ 5
主要是现在开源模型全是大号玩具,能满足复杂需求的开源少之又少,像稍微有点实用性的deepseek v3/r1,总计680b的参数,就算是fp4精度的也需要400g左右的显存才能跑爽,这还不算上下文要占用的显存,如果要追求非常满意的效果,至少需要fp8精度,这样的话需要的显存就是一个天文数字了,所以说真正有ai需求的还是用api吧,真正好用的御三家(gpt claude gemini)全是闭源的,就算是开源的deepseek,想用到fp8精度的也得需要买api。除非有朝一日claude能把自己的模型开源了(据说claude3.5仅不到200b),这种机器才能发挥作用
♥ 16 ↩ 5
AMD十几年前就研究统一内存架构,现在终于有用武之地了[doge]
♥ 16 ↩ 3
是的非常强,而且还运行的还是满血版的deepseek
♥ 13 ↩ 8
内存带宽一共就250G/s,真拿96G共享显存跑大模型,一秒蹦俩token?[笑哭]
♥ 13 ↩ 5
只能推理不能训练,只能是噱头
♥ 11 ↩ 21
内存带宽是硬伤啊[doge]
♥ 10 ↩ 4
怎么这么多人都在推笔记本部署大模型,真的有几个人用得上?
♥ 10
我看了某个b站老铁的记录,395+128g内存,跑70b只能10token/s,这速度真不行
♥ 7
最重要的token数没说,能部署和能用其实是两码事。
♥ 7
什么时候上主机端,部署个qwq玩玩
♥ 6
有云服务我为什么要费尽力气本地部署?
♥ 5 ↩ 7