我花了3700块,从闲鱼买了台双Tesla V100扩展柜,想一步到位玩转MoE,结果…
合集 · AI系列 (21)
-
Unraid部署Deepseek-R1模型全攻略(含A卡、N卡加速以及纯CPU环境)
19:05
-
899元6年前矿卡逆袭!双卡AMD RADEON VII暴跑70B大模型!
12:17
-
以后用NAS只要“说”就够了?——通过AI🤖部署基于Ubuntu的“NAS系统”实战
38:27
-
垃圾佬狂喜!300块的CPU+600块的计算卡?组装能跑70B模型的AI服务器是种什么体验?(浪潮SA5212M5 + 3x MI50)
12:06
-
【AI垃圾王】2500元不到装一台AI服务器!双Radeon VII解锁vLLM张量并行,性能暴涨6倍碾压Ollama!
8:00
-
别被“AI”忽悠了!1999元的小米AI眼镜,是年轻人的新玩具还是新“智商税”?
20:22
-
我花了3700块,从闲鱼买了台双Tesla V100扩展柜,想一步到位玩转MoE,结果…
12:12
-
说句话就能自动找番下载?我把本地80B大模型调教成了“追番特工”!
12:44
-
单卡双芯 48G 显存!打造 20L 紧凑型 AI 算力怪兽:DeepSeek 70B 实测 19 tokens/s
17:53
-
从自动写代码到智能影音刮削:实测 OpenCode,这台“赛博管家”真的能干苦力活
16:56
-
不用买macmini!手把手教你在NAS(LINUX虚拟机)里安装Clawdbot/Moltbot
24:54
-
一键部署Openclaw还能白嫖算力?绿联NAS送你“小龙虾”!
5:40
-
拒绝黄牛加价!1300块拿下M1“无头骑士”,这才是平民最强“养龙虾”神器?
7:43
-
AI时代买了个“黑白屏”?数码老爹深度实测!
7:59
-
别再当韭菜!600块组装Mac mini平替,跑AI Agent比白苹果还香?
7:04
-
铭凡 N5 MAX 首发评测!这才是真正的AI(O) NAS!120W 满血释放,16核32线程,本地AiAgent + 本地视频生成
15:54
-
AMD核显实战ComfyUI:七彩虹灵创K16如何包揽全套本地AI视频制作
13:00
-
榨干最强蓝厂显卡!单芯片32G的铭瑄Arc Pro B70,跑大模型/AI视频有多猛?
16:48
-
能跑 DeepSeek-V4 的"无头骑士"迷你主机——极摩客 EVO-X3 实测体验
9:53
-
2026 年了,工作室的 AIO 服务器应该会干什么?
17:36
-
最便宜的32G正规军、但算力砍四成:Arc Pro B65 到底值不值这8999
6:10
Description
期双Radeon VII的视频,我们用2400块实现了百T/s的32B大模型推理,但唯独啃不动MoE模型。 这次我怒砸3700块,从闲鱼搞来一套带300GB/s NVLink的“双V100扩展柜”,以为N卡总不会翻车了吧? 实测下来,它猛得像头野兽: 🔥 **AI对决:** 跑14B大模型,速度2倍于4060Ti;跑32B大模型,更是把5070Ti打成幻灯片! 🎮 **游戏性能:** TimeSpy跑分12600,2K《赛博朋克2077》稳定70帧,堪比3060Ti! 然而,当我启动此行的终极目标——Qwen3 MoE模型时,现实却给了我沉重一击…… 这期,我们就来硬核分析这台昔日王者的光辉与落寞,以及“捡垃圾”路上那些你不得不防的硬件和软件深坑! (觉得视频有帮助,别忘了点赞、投币、收藏三连支持一下~)
Comments
友情提示,mi50 vllm-gfx906大佬已经支持moe架构,速度非常可观[呲牙]
♥ 134 ↩ 23
[doge_金箍]
♥ 136 ↩ 16
友情提醒,turing都快停经了。volta请别被js忽悠了
♥ 58 ↩ 21
用lmdeploy,可以跑awq,v100 2080ti都可以,单路输出130每秒
♥ 37 ↩ 5
20系只适合跑int8模型 以现在的模型生态,至少选择 30系/A架构 以上的显卡,并且这个架构也只适合推理AWQ量化的模型。 40系/H架构 以上的显卡,多一个 fp8精度 的推理,也是现在国内模型很流行的推理精度。 50系/BW架构 以上的显卡,再多一个 mxFP4精度 的推理,也就是openai的gpt-oss使用的精度,也是可能是未来比较好的推理精度。
♥ 42 ↩ 1
据小道消息,vllm-gfx906 作者买双 v100 不到两个月就卖卡跑路
♥ 36 ↩ 1
²³³³³³³ 6666666666 太好看了 23333 awsl ²³³³³³³³³³³ ⁶⁶⁶⁶⁶⁶ ²³³³³³³ 6 太牛了!! ²³³³³³³ ⁶⁶⁶⁶⁶⁶ 厉害了 ²³³³³³³³³³³ 66666 太厉害了 66666 ²³³³³³³ UP牛批 ⁶⁶⁶⁶⁶ 这次一定 太好康了 ² ⁿⁿ 牛批 直接三连
♥ 31 ↩ 1
没我的八卡好玩[doge_金箍]
♥ 34 ↩ 9
up真的是yyds,以前玩nas的时候也看,现在玩ai了还看,哈哈。折腾区和捡垃圾区up主
♥ 22
我第一次见到8*v100能做到2u就在想这是什么赛博坦压缩技术,打开才知道是这种形式
♥ 23 ↩ 8
感觉v100最大的两个问题就是cuda计算能力和hbm容易寄( 一般来讲相对复杂推理/训练的框架往往只会支持到安培和往后的,很多东西只能用老版本跑,麻烦挺多的(这大概也是3090残值很高的原因之一吧) 但还是感谢缩图老师帮我圆当时的梦了。当时很馋v100的价格和显存,但最后还是怂了.jpg (大概是第一次制裁导致3090涨价到7000的日子)[法里达_心虚]
♥ 17 ↩ 1
这个价位了直接两个 3080 20 g 才是王道
♥ 16 ↩ 3
给你带来个更不好的消息,v100 16g改好涡轮散热的版本九百一张[妙啊]
♥ 19 ↩ 7
win11,买一个小黄鸭,用一张负责运算,另一个负责插帧,应该不只跑70帧。1080P能混300出头吧。
♥ 13 ↩ 6
大多数人对 语言模型一点兴趣都没有, 关心跑图速度 跑视频速度,50系的效率已经在提升, 新的ITX2模型 已经可以在 8G显存下 跑720P 16G显存下跑 1080P 以及 32G显存下跑4K 视频了,不知道 这类老算力卡 还能不能独挡天下^^
♥ 8 ↩ 2
前排我先睡了
♥ 8 ↩ 1
建议用llama.cpp跑gguf版本,我现在是双卡64G版本,拿来跑Qwen3-Coder-Next的80B,Q4模型还有60几个tokens. GLM-4.7-Flash 也可以。
♥ 7 ↩ 5
Qwen3 30B A3 B 2507Q3_K_L 单卡v100
♥ 7 ↩ 2
我用tesla P40和P100双卡跑成功跑通过vllm。一开始也是遇到各种报错,怀疑过算力问题,后来查到应该是官方编译的vllm不支持老的架构了,需要自己编辑vllm,还需要在编译配置里增加支持的架构版本,然后再编译。当时跑的是GLM-4。
♥ 7 ↩ 4