我花了3700块,从闲鱼买了台双Tesla V100扩展柜,想一步到位玩转MoE,结果…

合集 · AI系列 (21)

  1. 19:05
    Unraid部署Deepseek-R1模型全攻略(含A卡、N卡加速以及纯CPU环境)
  2. 12:17
    899元6年前矿卡逆袭!双卡AMD RADEON VII暴跑70B大模型!
  3. 38:27
    以后用NAS只要“说”就够了?——通过AI🤖部署基于Ubuntu的“NAS系统”实战
  4. 12:06
    垃圾佬狂喜!300块的CPU+600块的计算卡?组装能跑70B模型的AI服务器是种什么体验?(浪潮SA5212M5 + 3x MI50)
  5. 8:00
    【AI垃圾王】2500元不到装一台AI服务器!双Radeon VII解锁vLLM张量并行,性能暴涨6倍碾压Ollama!
  6. 20:22
    别被“AI”忽悠了!1999元的小米AI眼镜,是年轻人的新玩具还是新“智商税”?
  7. 12:12
    我花了3700块,从闲鱼买了台双Tesla V100扩展柜,想一步到位玩转MoE,结果…
  8. 12:44
    说句话就能自动找番下载?我把本地80B大模型调教成了“追番特工”!
  9. 17:53
    单卡双芯 48G 显存!打造 20L 紧凑型 AI 算力怪兽:DeepSeek 70B 实测 19 tokens/s
  10. 16:56
    从自动写代码到智能影音刮削:实测 OpenCode,这台“赛博管家”真的能干苦力活
  11. 24:54
    不用买macmini!手把手教你在NAS(LINUX虚拟机)里安装Clawdbot/Moltbot
  12. 5:40
    一键部署Openclaw还能白嫖算力?绿联NAS送你“小龙虾”!
  13. 7:43
    拒绝黄牛加价!1300块拿下M1“无头骑士”,这才是平民最强“养龙虾”神器?
  14. 7:59
    AI时代买了个“黑白屏”?数码老爹深度实测!
  15. 7:04
    别再当韭菜!600块组装Mac mini平替,跑AI Agent比白苹果还香?
  16. 15:54
    铭凡 N5 MAX 首发评测!这才是真正的AI(O) NAS!120W 满血释放,16核32线程,本地AiAgent + 本地视频生成
  17. 13:00
    AMD核显实战ComfyUI:七彩虹灵创K16如何包揽全套本地AI视频制作
  18. 16:48
    榨干最强蓝厂显卡!单芯片32G的铭瑄Arc Pro B70,跑大模型/AI视频有多猛?
  19. 9:53
    能跑 DeepSeek-V4 的"无头骑士"迷你主机——极摩客 EVO-X3 实测体验
  20. 17:36
    2026 年了,工作室的 AIO 服务器应该会干什么?
  21. 6:10
    最便宜的32G正规军、但算力砍四成:Arc Pro B65 到底值不值这8999
Description
期双Radeon VII的视频,我们用2400块实现了百T/s的32B大模型推理,但唯独啃不动MoE模型。
这次我怒砸3700块,从闲鱼搞来一套带300GB/s NVLink的“双V100扩展柜”,以为N卡总不会翻车了吧?

实测下来,它猛得像头野兽:
🔥 **AI对决:** 跑14B大模型,速度2倍于4060Ti;跑32B大模型,更是把5070Ti打成幻灯片!
🎮 **游戏性能:** TimeSpy跑分12600,2K《赛博朋克2077》稳定70帧,堪比3060Ti!

然而,当我启动此行的终极目标——Qwen3 MoE模型时,现实却给了我沉重一击……
这期,我们就来硬核分析这台昔日王者的光辉与落寞,以及“捡垃圾”路上那些你不得不防的硬件和软件深坑!

(觉得视频有帮助,别忘了点赞、投币、收藏三连支持一下~)

Comments

bearqq 2025-09-19

友情提示,mi50 vllm-gfx906大佬已经支持moe架构,速度非常可观[呲牙]

♥ 134 ↩ 23

一猫之下科技 2025-09-19

[doge_金箍]

♥ 136 ↩ 16

RagnarokChan 2025-09-19

友情提醒,turing都快停经了。volta请别被js忽悠了

♥ 58 ↩ 21

mars98k 2025-09-19

用lmdeploy,可以跑awq,v100 2080ti都可以,单路输出130每秒

♥ 37 ↩ 5

吾乃天酱 2025-09-22

20系只适合跑int8模型 以现在的模型生态,至少选择 30系/A架构 以上的显卡,并且这个架构也只适合推理AWQ量化的模型。 40系/H架构 以上的显卡,多一个 fp8精度 的推理,也是现在国内模型很流行的推理精度。 50系/BW架构 以上的显卡,再多一个 mxFP4精度 的推理,也就是openai的gpt-oss使用的精度,也是可能是未来比较好的推理精度。

♥ 42 ↩ 1

JoveYu 2025-09-19

据小道消息,vllm-gfx906 作者买双 v100 不到两个月就卖卡跑路

♥ 36 ↩ 1

恐龙玩具 2025-09-19

²³³³³³³  6666666666   太好看了 23333  awsl      ²³³³³³³³³³³   ⁶⁶⁶⁶⁶⁶   ²³³³³³³     6 太牛了!!   ²³³³³³³ ⁶⁶⁶⁶⁶⁶   厉害了           ²³³³³³³³³³³   66666         太厉害了   66666   ²³³³³³³    UP牛批                   ⁶⁶⁶⁶⁶     这次一定 太好康了 ² ⁿⁿ 牛批 直接三连

♥ 31 ↩ 1

胡桃的C137服务器工坊 2025-09-22

没我的八卡好玩[doge_金箍]

♥ 34 ↩ 9

MinervaSSx 2025-09-19

up真的是yyds,以前玩nas的时候也看,现在玩ai了还看,哈哈。折腾区和捡垃圾区up主

♥ 22

CRComRade 2025-09-19

我第一次见到8*v100能做到2u就在想这是什么赛博坦压缩技术,打开才知道是这种形式

♥ 23 ↩ 8

松風まつかぜ 2025-09-19

感觉v100最大的两个问题就是cuda计算能力和hbm容易寄( 一般来讲相对复杂推理/训练的框架往往只会支持到安培和往后的,很多东西只能用老版本跑,麻烦挺多的(这大概也是3090残值很高的原因之一吧) 但还是感谢缩图老师帮我圆当时的梦了。当时很馋v100的价格和显存,但最后还是怂了.jpg (大概是第一次制裁导致3090涨价到7000的日子)[法里达_心虚]

♥ 17 ↩ 1

老怕黑 2025-09-19

这个价位了直接两个 3080 20 g 才是王道

♥ 16 ↩ 3

战双单推人 2025-10-07

给你带来个更不好的消息,v100 16g改好涡轮散热的版本九百一张[妙啊]

♥ 19 ↩ 7

八正将 2025-09-25

win11,买一个小黄鸭,用一张负责运算,另一个负责插帧,应该不只跑70帧。1080P能混300出头吧。

♥ 13 ↩ 6

武汉之恋 2026-01-15

大多数人对 语言模型一点兴趣都没有, 关心跑图速度 跑视频速度,50系的效率已经在提升, 新的ITX2模型 已经可以在 8G显存下 跑720P  16G显存下跑 1080P 以及 32G显存下跑4K 视频了,不知道 这类老算力卡 还能不能独挡天下^^

♥ 8 ↩ 2

耀祖哥 2025-09-19

前排我先睡了

♥ 8 ↩ 1

bili_39601777622 2026-02-20

建议用llama.cpp跑gguf版本,我现在是双卡64G版本,拿来跑Qwen3-Coder-Next的80B,Q4模型还有60几个tokens. GLM-4.7-Flash 也可以。

♥ 7 ↩ 5

ZluxYao 2025-09-27

Qwen3 30B A3 B 2507Q3_K_L   单卡v100

♥ 7 ↩ 2

nijw1989 2025-09-20

我用tesla P40和P100双卡跑成功跑通过vllm。一开始也是遇到各种报错,怀疑过算力问题,后来查到应该是官方编译的vllm不支持老的架构了,需要自己编辑vllm,还需要在编译配置里增加支持的架构版本,然后再编译。当时跑的是GLM-4。

♥ 7 ↩ 4