Qwen3.8 27B Q2_K并发实况
合集 · Qwen3.8 27B本地部署潜能开发 (4)
Description
1、Ollama原生的端口肯定是不够用的,需要多实例配合转发脚本;
2、目前(勉强)保证质量的前提下可以用的大模型
Qwen3.8 27B Q4(活跃时占用28G显存):这个是之前玩自动驾驶用的那个,自己去翻特性;
Qwen3.8 27B Q3(活跃时占用24G显存):对显卡比较友好,温度65摄氏度,不足以煮熟鸡蛋(笑)。做调查与规划workflow是绰绰有余;
Qwen3.8 27B Q2(活跃时占用13G显存):本次视频的重点实验对象
Qwen3.8 9B(活跃时占用7G显存):好好当个机器人吧,其实让它干机器人的活我也不是特别敢
3、Q2大模型实际上容易出的问题
思考上下文不适配,总是容易炸思考,这种时候不得不切换成Q3继续;
偶尔发散到工作区外(好像不少大模型也会这样,应该不是量化引入的问题)
其他需要在Q2上验证的事情(还没做)
1、Workflow学习能力;
2、轮椅skill使用能力。