【中英双语】伯克利vLLM:PagedAttention生产级推理|原片合计58万+ 2023–2026
合集 · AI大模型实战 (43)
-
B站最好的CUDA系列课程04-CUDA编程前置技能精讲|C/C++底层关键点速通
49:01
-
【中英双语】Kimi K3实测:2.8万亿参数开源模型,编程能力真香还是翻车? | Fahd Mirza
24:43
-
【中英双语】vLLM vs 传统推理:KV缓存如何让GPU吞吐量翻倍?实测对比
22:30
-
【中文配音】大模型+机器学习面试通关全攻略| meta高级工程师主讲
8:37:21
-
【中英双语】10分钟掌握vLLM:从KV缓存瓶颈到生产级API服务全流程
27:23
-
【中文配音】约翰霍普金斯CUDA并行编程:从核函数到寄存器调优
1:39:58
-
【中文配音】C++校招方向-CUDA系列课程06-编写首个CUDA核函数|向量加法实战与内存模型
2:03:58
-
【中文配音】B站最好的CUDA系列课程11-从零实现MNIST GPU训练|CPU→CUDA全栈移植
2:23:05
-
【中文配音】B站最好的CUDA系列课程13-CUDA学习路径全景图|进阶方向与资源指南
0:40
-
【中文配音】B站最好的CUDA系列课程12-CUDA项目调优与调试|性能分析工具实战
13:38
-
【中文配音】AI infra基础设施详解
5:49
-
【中英双语】6GB显存跑Qwen 3.6 35B大模型llama.cpps实战?GTX 1060速度飙到17 token/s | Codacus
30:12
-
【中英双语】LTX 2.3 vs Wan 2.2:免费开源AI视频模型对决,谁才是最强? | MDMZ
16:36
-
【中英双语】llama.cpp更新让本地AI速度飙升65%,MacBook Pro实测 | Codacus
16:48
-
【中英双语】Ornith 35B vs Qwen 35B 本地大模型对决,16G显存实测谁更强? | Luke's Dev Lab
46:00
-
【中英双语】DeepSeek V4本地部署实测:3090/4090能跑吗?什么样的显卡可以跑DeepSeek,什么样的显卡可以跑qwen
21:40
-
【中英双语】12步搞定LLM训练全流程:数据、分词、预训练、LoRA微调,大模型微调
7:00:32
-
【中英双语】ComfyUI课程:从零学习ComfyUI, 短句/漫剧如何制作?
9:46:17
-
【中文配音】大模型面试必问的10个问题——从Transformer到Agent一次讲透
6:21:18
-
【中英双语】10分钟搞懂KV Cache:预填充与解码分离,让大模型推理效率飙升10倍,GPU内存省一半
24:16
-
【中英双语】保姆级机器学习从入门到实战:线性回归、SVM、聚类、集成学习全涵盖
19:50:18
-
【中英双语】大模型面试必问:KV Cache到底是什么?从零拆解推理加速原理
1:12:01
-
【中文配音】C++校招方向-CUDA系列课程08-加速矩阵乘法实战|Shared Memory优化技巧
2:47:23
-
【中文配音】B站最好的CUDA系列课程02-GPU加速深度学习实战 | GPU高性能计算实战
20:57
-
【中文配音】B站最好的CUDA系列课程01-课程导览 | GPU高性能计算实战
16:55
-
【中文配音】B站最好的CUDA系列课程09-Triton入门实战|简化CUDA编程新范式
42:17
-
【中英双语】通过5个项目学习PyTorch,学习底层AI必备PyTorch,PyTorch项目实战
11:38:32
-
【中英双语】同一个提示词,第一次1美元第二次5美分?大模型省钱的隐藏技巧 | Adam Rosler
13:02
-
【中文配音】C++校招方向-CUDA系列课程10-PyTorch CUDA扩展开发|自定义算子实战
13:30
-
【中英双语】从零手写大模型架构,我学到了什么?
1:45:54
-
【中英双语】学AI前必须先学机器学习?别走弯路,这才是正确入门路线 | Gaurav Sen
2:04
-
【中英双语】卡内基-深度学习系统课全解析-CMU Deep Learning Systems 10-414/714
41:11:30
-
【中文配音】B站最好的CUDA系列课程03-Windows/Linux双平台CUDA环境搭建|一键启用GPU开发
9:33
-
【中文配音】C++校招方向-CUDA系列课程07-CUDA API核心接口精解|内存管理与核函数调用
1:40:12
-
【中文配音】B站最好的CUDA系列课程05-GPU硬件架构全景解析|读懂显卡如何并行计算
15:52
-
【中英双语】从零手写Transformer到LLaMA|原片合计145万+ 2023–2024
26:12:14
-
【中英双语】AI基础设施(AI Infra)全解析:从单卡到千卡集群,GPU/vLLM/LLM-D实战 | KodeKloud
1:35:11
-
【中英双语】Llama.cpp vs vLLM:本地大模型引擎谁更强?实测对比帮你选 | IBM Technology
18:56
-
【中英双语】本地AI到底怎么跑?8B模型要16G显存?Ollama vs vLLM核心原理和工具选择 | Dots and Arrows
24:15
-
【中英双语】AI编程实战:LLM还是智能体?一次讲清怎么选怎么用
13:18
-
【中英双语】本地跑大模型加速:量化到底怎么选,实测省一半显存
38:03
-
【中英双语】16GB 内存跑本地大模型,Qwen 3.8 27B 微调版实测 | Luke's Dev Lab
34:12
-
【中英双语】伯克利vLLM:PagedAttention生产级推理|原片合计58万+ 2023–2026
19:26:37
Parts
- P1 · [中文] 01 vLLM 让 LLM 推理快 24 倍!UC伯克利开源方案
- P2 · [中文] 02 UC伯克利开源vLLM:大模型推理加速10倍,人人都能部署
- P3 · [中文] 03 vLLM 部署大模型:吞吐量提升3.5倍?GPU推理加速实战
- P4 · [中文] 04 vLLM凭什么快10倍?PagedAttention内存黑科技,大模型推理不再爆显存
- P5 · [中文] 05 vLLM如何让大模型推理提速10倍?UC伯克利开源引擎深度解析
- P6 · [中文] 06 vLLM生产级实战:一台GPU服务100+客户的自定义大模型
- P7 · [中文] 07 多台电脑合力跑大模型!vLLM分布式推理实测,4张显卡协同作战
- P8 · [中文] 08 Llama 405B 本地部署实测:4张A100跑通4050亿参数,vLLM+Docker全流程
- P9 · [中文] 09 vLLM 一年进化史:从爆火到生产级,开源 LLM 推理引擎的下一步
- P10 · [中文] 10 vLLM让LLM推理快8倍!PagedAttention如何做到?
- P11 · [中文] 11 Llama 3部署实战:vLLM黄金标准,CPU也能跑大模型
- P12 · [中文] 12 vLLM生产级部署:Kubernetes GPU集群实战,从零到上线
- P13 · [中文] 13 5步在私有K8s部署开源大模型:vLLM+Mistral实战
- P14 · [中文] 14 Ray+vLLM+Kubernetes:大模型部署三剑客,GPU效率翻倍实战
- P15 · [中文] 15 vLLM 生产级推理:PagedAttention 与投机解码,大模型部署必学
- P16 · [中文] 16 Kubernetes 跑大模型:企业级生成式 AI 部署实战
- P17 · [中文] 17 Kubernetes部署大语言模型:从零到实战,手把手教你跑ChatGPT
- P18 · [中文] 18 LLM推理加速9大优化技巧,从入门到精通
- P19 · [中文] 19 vLLM推理加速24倍!UC伯克利开源大模型部署神器
- P20 · [中文] 20 UC伯克利vLLM:开源LLM推理引擎如何做到又快又便宜?
- P21 · [中文] 21 vLLM让大模型推理速度飙升10倍!本地部署LLM不再卡顿
- P22 · [中文] 22 量化Llama 3.2部署:vLLM+RunPod低成本方案,比SageMaker便宜太多!
- P23 · [中文] 23 GPU和推理引擎怎么选?vLLM/SGLang/TGI/NIM四款实测,成本速度一目了然
- P24 · [中文] 24 5分钟用RunPod无服务器部署vLLM,大模型推理成本直降!
- P25 · [中文] 25 vLLM 部署大模型效率翻倍?Neural Magic 开源推理加速方案实测
- P26 · [中文] 26 用vLLM和K8s把AI成本打下来!OpenAI账单直降,开源模型真香
- P27 · [中文] 27 LitServe vs vLLM:谁才是大模型部署之王?Llama 3.1实战对比
- P28 · [中文] 28 vLLM如何让大模型推理快10倍?PagedAttention内存优化全解析
- P29 · [中文] 29 DeepSeek开源nano-vLLM:1200行Python干翻vLLM?8GB显卡也能跑
- P30 · [中文] 30 双卡RTX 3090本地部署vLLM:手把手跑通30B大模型,速度实测
- P31 · [中文] 31 10分钟掌握vLLM:从KV缓存瓶颈到生产级API服务全流程
- P32 · [中文] 32 vLLM本地部署提速指南:PagedAttention让大模型推理快10倍
- P33 · [英文] 01 Fast LLM Serving with vLLM and PagedAttention
- P34 · [英文] 02 vLLM: Easy, Fast, and Cheap LLM Serving for Everyone - Woosuk Kw…
- P35 · [英文] 03 vLLM: AI Server with 3.5x Higher Throughput
- P36 · [英文] 04 vLLM EXPOSED! The Shocking Truth Behind the Mystery
- P37 · [英文] 05 Accelerating LLM Inference with vLLM
- P38 · [英文] 06 Serve a Custom LLM for Over 100 Customers
- P39 · [英文] 07 Run A Local LLM Across Multiple Computers! (vLLM Distributed Inf…
- P40 · [英文] 08 Запуск Llama 405b на своем сервере. vLLM, docker.
- P41 · [英文] 09 The State of vLLM | Ray Summit 2024
- P42 · [英文] 10 Go Production: Super FAST LLM (API) Serving with vLLM !!!
- P43 · [英文] 11 Getting Started with vLLM (Llama 3 Inference for Dummies)
- P44 · [英文] 12 vLLM on Kubernetes in Production
- P45 · [英文] 13 How to Deploy LLM in your Private Kubernetes Cluster in 5 STEPS …
- P46 · [英文] 14 Efficient LLM Deployment: A Unified Approach with Ray, VLLM, and…
- P47 · [英文] 15 CUDA Mode Keynote | Lily Liu | vLLM
- P48 · [英文] 16 Running Generative AI & LLM on a Kubernetes Cluster | Cloud Inst…
- P49 · [英文] 17 Introduction to Large Language Models (LLM) on Kubernetes - Alex…
- P50 · [英文] 18 How to Efficiently Serve an LLM?
- P51 · [英文] 19 Exploring the fastest open source LLM for inferencing and servin…
- P52 · [英文] 20 vLLM: Easy, Fast, and Cheap LLM Serving, Woosuk Kwon, UC Berkeley
- P53 · [英文] 21 vLLM - Turbo Charge your LLM Inference
- P54 · [英文] 22 Deploying Quantized Llama 3.2 Using vLLM
- P55 · [英文] 23 How to pick a GPU and Inference Engine?
- P56 · [英文] 24 Deploy LLMs using Serverless vLLM on RunPod in 5 Minutes
- P57 · [英文] 25 Deploy LLMs More Efficiently with vLLM and Neural Magic
- P58 · [英文] 26 How we optimized AI cost using vLLM and k8s (Clip)
- P59 · [英文] 27 LitServe: Better Than vLLM? Deploy Llama 3.1 With Litserve
- P60 · [英文] 28 What is vLLM? Efficient AI Inference for Large Language Models
- P61 · [英文] 29 DeepSeek сделал НЕВОЗМОЖНОЕ! Забудьте CUDA — вот новый король ИИ…
- P62 · [英文] 30 Инструкция по запуску нейросети на своем сервере vLLM
- P63 · [英文] 31 Understanding vLLM with a Hands On Demo
- P64 · [英文] 32 vLLM: быстрый локальный запуск и ускорение диффузионных моделей
Description
伯克利开源推理引擎 vLLM:PagedAttention 把 LLM 服务做成可落地的生产件|原片合计58万+|中英双语可切换 📌 本期看点 · PagedAttention:KV Cache 分页后,吞吐和显存怎么同时涨 · 作者亲讲:Woosuk Kwon / Xiaoxuan Liu,从论文到生产级 serving · 本地多卡、K8s、量化 Llama,把推理引擎真正跑到业务里 🧭 观看指南 共32讲。P1–P32 为中文配音版,P33–P64 为英文原声版,可按需切换。 🎯 适合人群 要在自己的 GPU / 集群上部署大模型的算法工程、平台工程和转码自学同学。 持续更新海外名校硬核课程,点赞收藏关注三连,你的支持是更新的最大动力!
Comments
卡数相加可不等于吞吐线性涨啊。