deepseek r1 量化满血版纯内存推理

Description
内存:ddr4 24x32G 共768G

CPU:112 Intel(R) Xeon(R) Platinum 8280 CPU @ 2.70GHz

Comments

遗失的壹只猫 2025-02-22

一天17万token,官方16块100万token的价值。你这只产生2.76块价值。老哥你亏电费啊

♥ 11 ↩ 5

文剑丶水又二一 2025-02-21

24个32G内存。 AI还真是吃性能软件。看来对应硬件发展的需求只会越来越迫切。

♥ 7

-御坂桜- 2025-02-21

这个速度少数和大部分网友打字速度大差不差,调教好了全都回复短句的话当陪聊够用了

♥ 6 ↩ 1

紫枫闲人 2025-02-22

可以加个22G的2080TI显卡,跑KTransformer试试

♥ 4 ↩ 16

枫染秋裳月满霜 2025-02-21

搞出来了?输出速度怎么样?

♥ 3 ↩ 5

步慧编程 2025-02-21

速度感人[doge]

♥ 2 ↩ 2

寄居蟹65 2025-02-23

如何让ollmam加载到内存?麻烦说下

♥ 1 ↩ 4

想当年在北岗的时候 2025-02-23

感觉思考时间还是很快的,只是tokens蹦的慢

♥ 1 ↩ 2

みらい未来 2025-02-22

这个是int4量化,不是满血版

♥ 1 ↩ 1

Silencegogo_ 2025-02-22

还是太慢了,体验不太行,得10tokens以上才有可用的交互体验[OK]

♥ 1

冰瓜ice_melon 2025-02-21

强[打call]

♥ 1

编程分享录 2025-02-26

我也测试了,也是跑671b大模型,也是纯CPU推理,内存也是700多,感觉速度不太行,还是得上显卡跑。

♥ 1 ↩ 1

楠枫守雨 2025-02-24

跟我6138*2  384G我跑2.51  跑的速度一样

♥ 1

吃鸟的蟲 2025-02-23

大佬,直接把模型安装在内存里会不会快一点

♥ 1 ↩ 5

ASilentSausage 2025-02-22

如果是线程撕裂者2950x + ddr4 4×32G的话要带哪种卡才能达到每秒两tokens?有大佬知道吗?[doge]

♥ 1 ↩ 5

橘子橘子我来啦 2025-03-08

多少钱

士不士不 2025-02-26

如果是最新的8通道ddr5呢

Dr_R3dk1n9 2025-02-23

为什么我ollama内存跑不满啊

一夕-寒露 2025-02-22

700多g能跑8bit满血版了吧

↩ 1

三点几啦啦啦 2025-02-22

至强2代的指令集可以int8吗 感觉内存还得翻倍

↩ 1