Jah-Wn 1d ago 这也太慢了,要不试试mtp呢,395 8060s 60w 功耗限制下, 用Charlie12345/ROCmFPX版本llama-server跑rocmfp4-embeddingF16-headQ6的版本开mtp用Vulkan0能有45token/s的速度,不开也起码30+,这还是open-webui这个重的要死的前端跑的,用llama-webui会快得多 ♥ 1
UniCyber 9d ago 爆显存是这样的,给UP提供几个提速的优化项: * 把ROCm后端换成Vulkan后端,推理速度更快。 * AMD驱动里打开Smart Access Memory。 * 卸载18层专家到内存,llama.cpp对应的参数是--n-cpu-moe 18,LM Studio也有相关参数配置。 注:Qwen3.6-35B-A3B共40层专家,Q4量化版本每个专家层大约占用0.5GB显存。 ♥ 1 ↩ 1
Comments
我780m核显+32G内存跑相同模型也能有10+tokens/s的速度,这差距不对吧[思考]
♥ 2
这也太慢了,要不试试mtp呢,395 8060s 60w 功耗限制下, 用Charlie12345/ROCmFPX版本llama-server跑rocmfp4-embeddingF16-headQ6的版本开mtp用Vulkan0能有45token/s的速度,不开也起码30+,这还是open-webui这个重的要死的前端跑的,用llama-webui会快得多
♥ 1
我感觉35b不如ornith
♥ 1
我看了一下,你这个是35B的,然后你的这个GPU内存已爆掉了,你应该卸载部分到内存里面去,而不是全部塞在这个GPU里
♥ 1
5060 8g跑q6量化的有30tps以上,你这个肯定哪里不对
♥ 1 ↩ 3
爆显存是这样的,给UP提供几个提速的优化项: * 把ROCm后端换成Vulkan后端,推理速度更快。 * AMD驱动里打开Smart Access Memory。 * 卸载18层专家到内存,llama.cpp对应的参数是--n-cpu-moe 18,LM Studio也有相关参数配置。 注:Qwen3.6-35B-A3B共40层专家,Q4量化版本每个专家层大约占用0.5GB显存。
♥ 1 ↩ 1
lm比llama好吗
♥ 1 ↩ 1
9070xt应该不止这点速度吧
♥ 2 ↩ 4
还不如千问3.6 35a3b
♥ 1 ↩ 4
7900Xtx可能会更快一点
♥ 1 ↩ 2