【中英双语】6GB显存跑Qwen 3.6 35B大模型llama.cpps实战?GTX 1060速度飙到17 token/s | Codacus

合集 · AI大模型实战 (43)

  1. 49:01
    B站最好的CUDA系列课程04-CUDA编程前置技能精讲|C/C++底层关键点速通
  2. 24:43
    【中英双语】Kimi K3实测:2.8万亿参数开源模型,编程能力真香还是翻车? | Fahd Mirza
  3. 22:30
    【中英双语】vLLM vs 传统推理:KV缓存如何让GPU吞吐量翻倍?实测对比
  4. 8:37:21
    【中文配音】大模型+机器学习面试通关全攻略| meta高级工程师主讲
  5. 27:23
    【中英双语】10分钟掌握vLLM:从KV缓存瓶颈到生产级API服务全流程
  6. 1:39:58
    【中文配音】约翰霍普金斯CUDA并行编程:从核函数到寄存器调优
  7. 2:03:58
    【中文配音】C++校招方向-CUDA系列课程06-编写首个CUDA核函数|向量加法实战与内存模型
  8. 2:23:05
    【中文配音】B站最好的CUDA系列课程11-从零实现MNIST GPU训练|CPU→CUDA全栈移植
  9. 0:40
    【中文配音】B站最好的CUDA系列课程13-CUDA学习路径全景图|进阶方向与资源指南
  10. 13:38
    【中文配音】B站最好的CUDA系列课程12-CUDA项目调优与调试|性能分析工具实战
  11. 5:49
    【中文配音】AI infra基础设施详解
  12. 30:12
    【中英双语】6GB显存跑Qwen 3.6 35B大模型llama.cpps实战?GTX 1060速度飙到17 token/s | Codacus
  13. 16:36
    【中英双语】LTX 2.3 vs Wan 2.2:免费开源AI视频模型对决,谁才是最强? | MDMZ
  14. 16:48
    【中英双语】llama.cpp更新让本地AI速度飙升65%,MacBook Pro实测 | Codacus
  15. 46:00
    【中英双语】Ornith 35B vs Qwen 35B 本地大模型对决,16G显存实测谁更强? | Luke's Dev Lab
  16. 21:40
    【中英双语】DeepSeek V4本地部署实测:3090/4090能跑吗?什么样的显卡可以跑DeepSeek,什么样的显卡可以跑qwen
  17. 7:00:32
    【中英双语】12步搞定LLM训练全流程:数据、分词、预训练、LoRA微调,大模型微调
  18. 9:46:17
    【中英双语】ComfyUI课程:从零学习ComfyUI, 短句/漫剧如何制作?
  19. 6:21:18
    【中文配音】大模型面试必问的10个问题——从Transformer到Agent一次讲透
  20. 24:16
    【中英双语】10分钟搞懂KV Cache:预填充与解码分离,让大模型推理效率飙升10倍,GPU内存省一半
  21. 19:50:18
    【中英双语】保姆级机器学习从入门到实战:线性回归、SVM、聚类、集成学习全涵盖
  22. 1:12:01
    【中英双语】大模型面试必问:KV Cache到底是什么?从零拆解推理加速原理
  23. 2:47:23
    【中文配音】C++校招方向-CUDA系列课程08-加速矩阵乘法实战|Shared Memory优化技巧
  24. 20:57
    【中文配音】B站最好的CUDA系列课程02-GPU加速深度学习实战 | GPU高性能计算实战
  25. 16:55
    【中文配音】B站最好的CUDA系列课程01-课程导览 | GPU高性能计算实战
  26. 42:17
    【中文配音】B站最好的CUDA系列课程09-Triton入门实战|简化CUDA编程新范式
  27. 11:38:32
    【中英双语】通过5个项目学习PyTorch,学习底层AI必备PyTorch,PyTorch项目实战
  28. 13:02
    【中英双语】同一个提示词,第一次1美元第二次5美分?大模型省钱的隐藏技巧 | Adam Rosler
  29. 13:30
    【中文配音】C++校招方向-CUDA系列课程10-PyTorch CUDA扩展开发|自定义算子实战
  30. 1:45:54
    【中英双语】从零手写大模型架构,我学到了什么?
  31. 2:04
    【中英双语】学AI前必须先学机器学习?别走弯路,这才是正确入门路线 | Gaurav Sen
  32. 41:11:30
    【中英双语】卡内基-深度学习系统课全解析-CMU Deep Learning Systems 10-414/714
  33. 9:33
    【中文配音】B站最好的CUDA系列课程03-Windows/Linux双平台CUDA环境搭建|一键启用GPU开发
  34. 1:40:12
    【中文配音】C++校招方向-CUDA系列课程07-CUDA API核心接口精解|内存管理与核函数调用
  35. 15:52
    【中文配音】B站最好的CUDA系列课程05-GPU硬件架构全景解析|读懂显卡如何并行计算
  36. 26:12:14
    【中英双语】从零手写Transformer到LLaMA|原片合计145万+ 2023–2024
  37. 1:35:11
    【中英双语】AI基础设施(AI Infra)全解析:从单卡到千卡集群,GPU/vLLM/LLM-D实战 | KodeKloud
  38. 18:56
    【中英双语】Llama.cpp vs vLLM:本地大模型引擎谁更强?实测对比帮你选 | IBM Technology
  39. 24:15
    【中英双语】本地AI到底怎么跑?8B模型要16G显存?Ollama vs vLLM核心原理和工具选择 | Dots and Arrows
  40. 13:18
    【中英双语】AI编程实战:LLM还是智能体?一次讲清怎么选怎么用
  41. 38:03
    【中英双语】本地跑大模型加速:量化到底怎么选,实测省一半显存
  42. 34:12
    【中英双语】16GB 内存跑本地大模型,Qwen 3.8 27B 微调版实测 | Luke's Dev Lab
  43. 19:26:37
    【中英双语】伯克利vLLM:PagedAttention生产级推理|原片合计58万+ 2023–2026

Parts

  1. P1 · [中文] 6GB显存跑Qwen 3.6 35B大模型llama.cpps实战?GTX 1060速度飙到17 token/s | Codacus
  2. P2 · [英文] 6GB显存跑Qwen 3.6 35B大模型llama.cpps实战?GTX 1060速度飙到17 token/s | Codacus
Description
仅用6GB显存的GTX 1060运行350亿参数大模型,从3 token/s优化到17 token/s。详解llama.cpp的MoE卸载、内存调优及关键参数,让老显卡也能流畅本地AI。

🎬 章节
00:00 不可能的任务
00:27 环境配置
01:46 默认慢速原因
02:52 MoE突破
04:33 修复内存瓶颈
05:32 达到17 tok s
06:40 4倍上下文技巧
09:23 稳定性修复
11:04 失败尝试
13:32 五大关键参数

Comments

阿牛アニュウ 2026-06-18

他没有说是用哪个版本的量化

♥ 7 ↩ 4

星卡管家 2026-06-19

100T ,带启动参数,自取对比硬件调参数。

♥ 5 ↩ 5

爱莉妹妹- 2026-06-21

我3g显存都能10tokens每秒

♥ 4 ↩ 10

blsSky 2026-06-21

联想拯救者 居然还能跑 但是超级慢 不知道还有没有大神来优化一下 让他输出再快一些。[笑哭][笑哭][笑哭]

♥ 4 ↩ 23

雨夜打灰 2026-06-18

为什么他的1060可以放20层,我的1080只能放最多16层?

♥ 4 ↩ 2

四卡虾 2026-06-24

原视频https://www.youtube.com/watch?v=9vY4-Z-tkHs

♥ 3

GIRPESY 2026-06-20

没有原视频地址吗?

♥ 3 ↩ 1

此心光明__亦复何言 2026-06-22

i5-6500能不能行?能行我电脑就枯木逢春了[笑哭][滑稽][喜极而泣]

♥ 3 ↩ 7

Chenners 2026-06-20

请问8G显卡,16G内存可行不?内存小了点

♥ 3 ↩ 7

落叶的忧伤2333 2026-08-04

能跑 但是只能跑一点点。。。1070 8g和5070 12g 我都测试过了。。。。。 1070优化能有10,5070优化能有40-50 都是开了思考模式

♥ 2 ↩ 1

流龙马 2026-06-18

UP主加油!

♥ 2

一键AI笔记侠 2026-07-08

总结评论区自取,顺手去原视频那投个币,好UP主值得

♥ 2

ggyy3k 2026-06-19

--cache-type-k turbo4 ^ --cache-type-v turbo3 ^ turbo4 /turbo3 = TurboQuant+ 新型 KV 缓存压缩(第三方 fork 扩展,非主线 llama.cpp)

♥ 3 ↩ 3

艾卡西亚季风_ 7d ago

3060 8g 16内存,想接入trae写代码用啥好[笑哭]

♥ 1 ↩ 1

疏散星团m45 2026-07-13

960 2G,可否一战

♥ 1

浅梦藏心lzf 2026-07-07

我是lmstudio,里面每个操作我都不会[大哭]

♥ 1 ↩ 1

天才美少女小乔 2026-07-05

请问你运行的是哪个量化版本呢?

♥ 1 ↩ 6

bili_21048919111 2026-06-22

使用这些参数,上下文变成4096无法更改

♥ 1 ↩ 1

MBABar 2026-07-11

搬运的是油管一个印度老兄的视频吧

♥ 1