技术Flow
内存:ddr4 24x32G 共768G CPU:112 Intel(R) Xeon(R) Platinum 8280 CPU @ 2.70GHz
一天17万token,官方16块100万token的价值。你这只产生2.76块价值。老哥你亏电费啊
♥ 11 ↩ 5
24个32G内存。 AI还真是吃性能软件。看来对应硬件发展的需求只会越来越迫切。
♥ 7
这个速度少数和大部分网友打字速度大差不差,调教好了全都回复短句的话当陪聊够用了
♥ 6 ↩ 1
可以加个22G的2080TI显卡,跑KTransformer试试
♥ 4 ↩ 16
搞出来了?输出速度怎么样?
♥ 3 ↩ 5
速度感人[doge]
♥ 2 ↩ 2
如何让ollmam加载到内存?麻烦说下
♥ 1 ↩ 4
感觉思考时间还是很快的,只是tokens蹦的慢
♥ 1 ↩ 2
这个是int4量化,不是满血版
♥ 1 ↩ 1
还是太慢了,体验不太行,得10tokens以上才有可用的交互体验[OK]
♥ 1
强[打call]
我也测试了,也是跑671b大模型,也是纯CPU推理,内存也是700多,感觉速度不太行,还是得上显卡跑。
跟我6138*2 384G我跑2.51 跑的速度一样
大佬,直接把模型安装在内存里会不会快一点
♥ 1 ↩ 5
如果是线程撕裂者2950x + ddr4 4×32G的话要带哪种卡才能达到每秒两tokens?有大佬知道吗?[doge]
多少钱
如果是最新的8通道ddr5呢
为什么我ollama内存跑不满啊
700多g能跑8bit满血版了吧
↩ 1
至强2代的指令集可以int8吗 感觉内存还得翻倍
Comments
一天17万token,官方16块100万token的价值。你这只产生2.76块价值。老哥你亏电费啊
♥ 11 ↩ 5
24个32G内存。 AI还真是吃性能软件。看来对应硬件发展的需求只会越来越迫切。
♥ 7
这个速度少数和大部分网友打字速度大差不差,调教好了全都回复短句的话当陪聊够用了
♥ 6 ↩ 1
可以加个22G的2080TI显卡,跑KTransformer试试
♥ 4 ↩ 16
搞出来了?输出速度怎么样?
♥ 3 ↩ 5
速度感人[doge]
♥ 2 ↩ 2
如何让ollmam加载到内存?麻烦说下
♥ 1 ↩ 4
感觉思考时间还是很快的,只是tokens蹦的慢
♥ 1 ↩ 2
这个是int4量化,不是满血版
♥ 1 ↩ 1
还是太慢了,体验不太行,得10tokens以上才有可用的交互体验[OK]
♥ 1
强[打call]
♥ 1
我也测试了,也是跑671b大模型,也是纯CPU推理,内存也是700多,感觉速度不太行,还是得上显卡跑。
♥ 1 ↩ 1
跟我6138*2 384G我跑2.51 跑的速度一样
♥ 1
大佬,直接把模型安装在内存里会不会快一点
♥ 1 ↩ 5
如果是线程撕裂者2950x + ddr4 4×32G的话要带哪种卡才能达到每秒两tokens?有大佬知道吗?[doge]
♥ 1 ↩ 5
多少钱
如果是最新的8通道ddr5呢
为什么我ollama内存跑不满啊
700多g能跑8bit满血版了吧
↩ 1
至强2代的指令集可以int8吗 感觉内存还得翻倍
↩ 1