Turing· 2d ago kv cache可以设置fp8的,我4090 48用vllm默认bf16只能开256K上下文,剩下6G左右需要给其他服务用。现在kv cache改了fp8,显存占用降低了些,上下文容量翻倍500+,测试过精度损失可以忽略不计,多并发速度也提升不少,10并发可以每个70+tok/s ♥ 4 ↩ 2
新笨笨猪 16h ago 看了半天,怎么优化一句话没说?只说了选择模型的量化版本,启动命令参数、jinja模板是否调式过?上下文不足的时候优化的是压缩?截断输出重读取?还是脚本?实质性的东西一句话都没有
AItair_ 2d ago 一开始我也是不放心让27b自己干,总想着看看它在搞什么,后来发现它干活真的挺靠谱的(指令遵循不错,但提示词写不对的话是有点死脑筋),full access 都给过好几次了。另外社区有一个修复版的思考模板,可以试试那个的效果,我感觉xhigh的质量比另两个档位强太多,不用可惜了。 ♥ 2 ↩ 1
夕一七 2d ago 本地部署还是有点尴尬,跑的时候得给显卡腾显存。对于我这种就一台电脑的人,最好的使用情况大概是白天用api,晚上跑个长一点的任务让他自主运行,弄完自动关机。估计这样能省一点钱 ♥ 7 ↩ 6
Comments
ds4.1flah 已经逆天了[doge]那输出速度吓哭了
♥ 88 ↩ 16
[doge_金箍]正好赶上deepseek降价了才发,八云永远吃不上热乎的[笑哭]
♥ 18 ↩ 2
ai 和 powershell 打架真的是要命[笑哭]
♥ 34 ↩ 20
这破模型上下文一长老慢了,不如3.8flash的一根
♥ 1
❌折旧 ✅升值 越用越贵
♥ 3 ↩ 1
哥你发视频的时候已经又降了[doge]
♥ 4 ↩ 1
Q4,24g显存上下文能做到128k么?
用ninfer 4090能254k上下文跑90+ tps,這週我是用爽了[吃瓜]
♥ 7 ↩ 4
开头这么重要的位置,先整了几句废话
kv cache可以设置fp8的,我4090 48用vllm默认bf16只能开256K上下文,剩下6G左右需要给其他服务用。现在kv cache改了fp8,显存占用降低了些,上下文容量翻倍500+,测试过精度损失可以忽略不计,多并发速度也提升不少,10并发可以每个70+tok/s
♥ 4 ↩ 2
本地不能并发太多[笑哭]
♥ 2
但是你得先有一张5090啊,这个钱买token能买老久了
♥ 1
不是,我中日情侣博主呢?
♥ 1
我选择买27b的API[doge]
♥ 1
本地电费可以试试我的计算器[doge] https://b23.tv/DCLVRV8
♥ 4 ↩ 2
看了半天,怎么优化一句话没说?只说了选择模型的量化版本,启动命令参数、jinja模板是否调式过?上下文不足的时候优化的是压缩?截断输出重读取?还是脚本?实质性的东西一句话都没有
dsv4.1太快了,和本地部署qw差了3~4倍,之前不到2倍,现在还是用api香,时间也是钱[笑哭]
♥ 1
一开始我也是不放心让27b自己干,总想着看看它在搞什么,后来发现它干活真的挺靠谱的(指令遵循不错,但提示词写不对的话是有点死脑筋),full access 都给过好几次了。另外社区有一个修复版的思考模板,可以试试那个的效果,我感觉xhigh的质量比另两个档位强太多,不用可惜了。
♥ 2 ↩ 1
本地部署还是有点尴尬,跑的时候得给显卡腾显存。对于我这种就一台电脑的人,最好的使用情况大概是白天用api,晚上跑个长一点的任务让他自主运行,弄完自动关机。估计这样能省一点钱
♥ 7 ↩ 6