告别云端 API 焦虑与泄密风险!雷神水冷迷你AI工作站实测:这才是私有化 AI 的完全体

Description
玩本地大模型,显存不够怎么破?高配 Mac 太贵,二手溢价太高? 今天我们来硬核拆解这台首发价 26999 元的雷神水冷迷你 AI 工作站!

作为目前大模型时代的本地生产力猛兽,它拥有全铝质感机身、定制的 120W 岛式水冷散热系统,更是搭载了 AMD 锐龙 AI Max+ 395 处理器与 128GB LPDDR5X 满血内存(可一键划出 96G 超大显存)!

本期视频,我们将从内部拆解、极限烤机、多模型本地部署、局域网 API 调用、私有化 Agent 场景实战,到 ComfyUI 4K 视频原生生成,带你全面探究这台机器的真实 AI 生产力!到底值不值这个价?答案在视频里。

Comments

SukeMeu 2026-05-30

我用ai max+395 128G跑了一下deepseek v4 flash Q2, 速度只有6t/s,一天下来才50w token, 换算下来api1块钱, 机器持续100w的功耗跑, 算下来耗电量比调用api都高,划不来。剩下的就是要么跑qwen 3.6 27B这种稠密模型,模型能力比较强, 但是速度也只有15-20t/s, 还有就是qwen 3.6 35B A3B这种MOE模型, 虽然没有那么强,这个速度确实还可以, 剩下的GPT-OSS-120B、Nemotron 3和Gemma 4这些都是一坨。 我自己用下来这种机器真是不如调用api, 要么能力不强,强的模型速度又太慢, 除非你的工作流每天token量上亿且35BA3B模型可以满足需求的时候才值得买, 目前这个机器我就放那里只跑了HY-MT2的翻译模型。

♥ 130 ↩ 40

愚者先生的眷者路人A 2026-05-30

问为什么“核显也能跑大模型”“大模型不是应该用独显跑”是人 我来告诉你们为什么 在本地大模型推理(特别是自回归解码阶段)中,内存带宽确实是决定生成速度的第一瓶颈,算力反而常常是富余的。 如果能设计一个 20 通道以上的 CPU 内存平台,让内存带宽达到甚至超过某些大显存 GPU,那么在理论上,CPU 的 token 生成速度完全可以接近甚至持平这些 GPU。 大模型每次生成一个 token,本质上是把全部模型权重从内存/显存里读一遍,进行少量矩阵运算。 以 FP16 的 LLaMA-2 7B 为例: 参数量约 7B,占 14 GB 左右。 每生成一个 token,必须把这 14 GB 数据几乎全读一遍(忽略 KV cache 等细节)。 ·如果可用带宽是 B (GB/s),那么纯内存搬运的最短时间 ≈ 14 / B 秒。 这一过程计算量并不大,现代 CPU 的 AVX-512 / AMX 算力跑 7B 这种模型是够用的。所以生成速度 ≈ 有效带宽 ÷ 模型大小(GB),瓶颈在带宽。 2. 20+ 通道 DDR5 的理论带宽 以 DDR5-6400 为例,单通道带宽约 51.2 GB/s: 8 通道:约 409.6 GB/s 12 通道:约 614.4 GB/s(AMD EPYC 9004 系列) 20 通道:约 1024 GB/s(1 TB/s) 对比几款“大显存显卡”的显存带宽: RTX 4090:约 1 TB/s(GDDR6X) RTX 3090:约 936 GB/s A100 80GB:约 2 TB/s(HBM2e) H100:约 3.35 TB/s(HBM3) 可以看到,如果真有 20 通道 DDR5-6400,理论带宽 ≈ 1 TB/s,已经能媲美 RTX 4090 / 3090 级别,但距离 HBM 的 A100/H100 还有明显差距。 也就是说,至少在消费级/半专业大显存卡这个范围,“20 通道 CPU 平台”在带宽上并不吃亏。

♥ 89 ↩ 21

RedMail 2026-05-30

1个w刚配了这个玩意, 找了两张25年产在保的卡,兄弟们我亏了没有[翻白眼]

♥ 46 ↩ 126

MrBb1588 2026-05-31

這個才是我的流動ai agent[笑哭]

♥ 37 ↩ 11

SPOTLITE 2026-05-31

自从千问3.6砍掉122B这个规格之后,128G的统一内存已经没有意义了。32G甚至24G显存都已经足够跑27B/31B的模型了,而下一个档位就要到minimax的229B级别了。而到这里就会出现极其无解的“量化悖论”:如果你嫌弃Qwen27B的Q4量化,那么你的128G内存也只能跑Q3甚至Q2级别更低精度量化的minimax2.7[doge]

♥ 34 ↩ 3

CDONGH 2026-06-03

指望告别云端焦虑是一点都告别不了。铭凡ms-s1路过,折腾了几个月本地模型,发现现在本地模型跑agent就只能拿来配两个还不错的reranker和embedding模型.指望部署agent 干活是干不了的,要不等死,要不蠢死。

♥ 19 ↩ 8

K字母的后面是U 2026-05-30

没必要用水冷,对Ai而言,功耗没必要这么高,85W足以。那么风冷的395只要18000出头。但目前我觉得395机器已经没多少性价比了。还有,这个视频下评论的,基本都是不懂的,纯扯,不要被误导。我买了两台395,能不能深度跑AI,当然可以,只不过目前想完全实现龙虾自由,395不够,需要能跑397b-q6的机器。

♥ 18 ↩ 8

打美国捐钱 2026-05-30

prefill没3000不用考虑本地

♥ 16 ↩ 7

玖兰枢喵丶 2026-06-01

什么狗屁生产力,卖铲子的人才是最赚钱的[笑哭]

♥ 13 ↩ 1

Neoczr 2026-05-30

AMD 跑AI兼容性能让你绝望!

♥ 20 ↩ 15

下坪溪 2026-05-30

之前考虑过买 Mac Studio M3 Ultra,128G 内存要四万多,而且只能划出 24G 显存,跑大模型完全不行,这个性价比高太多了

♥ 20 ↩ 10

MicroCoding 2026-06-06

AI MAX395 1w+的溢价就很离谱了,这东西居然能到快3W?这128g内存还是太值钱了

♥ 10

Bruh0 2026-05-30

这价格买 M4 Max、M5 Max 简直香到爆炸。

♥ 12

键盘程序员 2026-06-14

正在用395写代码[doge]反正这些模型实战都很辣鸡[辣眼睛]

♥ 8 ↩ 6

风川白日 2026-06-02

又是395。 超过1.5w的都下一个了。对于需要各种模型测试的还行,用来当生产力还是不行

♥ 8 ↩ 1

kiddson 2026-05-30

苹果应该会在6月WWDC发布M5 ultra的Mac Studio,估计新的M5 ultra一发售又要卖断货。

♥ 7 ↩ 1

床边飞行日记 2026-05-31

这个qwen3.6-35b-a3b的token速度和3000块钱的双卡v100差不多

♥ 6 ↩ 9

道隐于铭 2026-05-30

太慢了,跑qwen3.627b才12.78token/s,我7900xtx部署 qwen3.6 27b q4kxl 60k上下文能有40token/s的性能

♥ 6

老年车哈哈哈 2026-05-30

我们是 5 个人的设计工作室,平时需要用 ComfyUI 生成 4K 视频和图片,云端生成不仅慢还贵,这个看起来正好适合我们

♥ 8 ↩ 14