AMD显卡本地运行Qwen3.6 35B模型测速

Description
显卡:RX 9070 XT(16G显存)
后端:ROCm
模型:qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive(Q4_K_M)
测速内容:看图写作

Comments

风的旅者-李 7d ago

我780m核显+32G内存跑相同模型也能有10+tokens/s的速度,这差距不对吧[思考]

♥ 2

Jah-Wn 1d ago

这也太慢了,要不试试mtp呢,395 8060s 60w 功耗限制下, 用Charlie12345/ROCmFPX版本llama-server跑rocmfp4-embeddingF16-headQ6的版本开mtp用Vulkan0能有45token/s的速度,不开也起码30+,这还是open-webui这个重的要死的前端跑的,用llama-webui会快得多

♥ 1

cnxo2fou 8d ago

我感觉35b不如ornith

♥ 1

我的王之力啊123 7d ago

我看了一下,你这个是35B的,然后你的这个GPU内存已爆掉了,你应该卸载部分到内存里面去,而不是全部塞在这个GPU里

♥ 1

劫灰1999 6d ago

5060 8g跑q6量化的有30tps以上,你这个肯定哪里不对

♥ 1 ↩ 3

UniCyber 9d ago

爆显存是这样的,给UP提供几个提速的优化项: * 把ROCm后端换成Vulkan后端,推理速度更快。 * AMD驱动里打开Smart Access Memory。 * 卸载18层专家到内存,llama.cpp对应的参数是--n-cpu-moe 18,LM Studio也有相关参数配置。 注:Qwen3.6-35B-A3B共40层专家,Q4量化版本每个专家层大约占用0.5GB显存。

♥ 1 ↩ 1

雪梨你可长点心吧 9d ago

lm比llama好吗

♥ 1 ↩ 1

天子的离别 9d ago

9070xt应该不止这点速度吧

♥ 2 ↩ 4

希望只衬托绝望 9d ago

还不如千问3.6 35a3b

♥ 1 ↩ 4

耳朵的水 9d ago

7900Xtx可能会更快一点

♥ 1 ↩ 2