zhonghuihong 2025-03-04 高通的8gen1~3还有elite可以跑llama.cpp的OpenCL加速。在8elite上,跟纯CPU跑速度上没明显优势,不过在功耗上挺有优势的。用scene查看功耗,CPU版一开始在12w,我的小米15很快就过热降频到10w了。GPU加速的一直在8w多,平均速度还比CPU的略快一点点。不过我试的是q4_0量化的,因为据说GPU加速只优化了q4_0量化版。 ♥ 6 ↩ 3
Comments
高通的8gen1~3还有elite可以跑llama.cpp的OpenCL加速。在8elite上,跟纯CPU跑速度上没明显优势,不过在功耗上挺有优势的。用scene查看功耗,CPU版一开始在12w,我的小米15很快就过热降频到10w了。GPU加速的一直在8w多,平均速度还比CPU的略快一点点。不过我试的是q4_0量化的,因为据说GPU加速只优化了q4_0量化版。
♥ 6 ↩ 3
牛逼
♥ 1 ↩ 1
有机会用手机部署miloco吗
qwq-32b能带动吗[doge]
直接用MNN会不会更方便
大佬[喜欢] 机型相同,但是意义不大,不弄了[脱单doge]
以前的小米 跑个分吧 最近的小米 跑个原吧 未来的小米 跑个Deepseek吧 [doge]
能不能通过ssh连接手机
↩ 2
mali gpu能编译llama.cpp调用Vulkan后端跑,但性能还不如纯CPU[吃瓜]
woc
求流程
↩ 1