Description
DeepSeek-V4 家族第一个视觉模型来了:V4-Flash-Vision-Exp,8 月 31 日权重 MIT 开源。看图按张计费一张最多 384 token。一支视频看完全部数据。
看点:
1. 官方提到多模态 Agent 能力"接近 Opus-4.8"
2. 计费上限就是架构上限:模型配置文件里写死 384 token,2000×2000 和 5000×5000 的图一个价,一万张截图不到一美元
3. 视觉模块只加了 4.66 亿参数(总量的千分之 1.5),文本七项还小涨——做过多模态的人知道"加视觉不伤文本"有多难
关键内容:
· 定位:V4 家族首个视觉模型 · 基座 V4-Flash + 视觉编码模块 + Exp 实验版标记 · 截图/图表/网页界面/文档扫描件直接输入
· 多模态四项 vs Opus-4.8:Agents' Last Exam 27.3/25.7 胜 · ZeroBench 35/34 胜 · ApexBench 36.5/39.4 负 · Chartography 64.3/65.0 负
· 纯文本七项 vs 0731:TB2.1 82.7→83.9 · DeepSWE 54.4→59.3 · Toolathlon 70.3→75.9 · NL2Repo/DSBench 同升 · 仅 Cybergym 微降 1.4
· 诚实对照:11 项基准 8 项落后 Opus-4.8 · NL2Repo 落后 12 分 · 多模态追平、文本代差仍在
· 计费:单张图最多 384 token = vision_max_n_token 架构上限 · <384×384 先放大再识别
· 费率:非高峰输入 $0.22/1M · 输出 $0.66 · 高峰=北京工作日白天(9-12/14-18),夜间周末半价 · 缓存命中 $0.007
· 算账:10000 张截图 ≈ $0.85 · 30 屏 Agent 任务视觉输入 ≈ $0.003 · 同任务 V4-Pro 要 3 倍
· 省钱细节:low 档先缩 512×512 · Files API 免费按 file_id 复用
· 架构:总参数 3046 亿(HF 实测)· 视觉模块 +4.66 亿占 0.15% · 视觉塔 32 层 · patch 14px · 下采样 3× · 长宽比 ≤8:1
· 规格:上下文 1M · 最大输出 384K · 权重 167.8GB · FP8+FP4 · 256 专家激活 6 · DSpark 投机解码草稿同包
· 接口:Chat Completions / Messages / Responses 三套 · 600 张图/请求 · 并发 2500 = Pro×5 · thinking 默认开 · 独立模型名老集成零影响
· 生态:dsh v0.1.1 与模型同日发布(GitHub 08-21 07:12 UTC 可查)· OpenRouter 上线首周调用量第一的应用就是 DeepSeek Harness(22.9B tokens,第三方数据),Claude Code 排第三
· 案例:Agent 做西藏自驾游 PPT · dsh 官网未来主义重构 · 黏土怪物前端动效(官方演示)
· 开源:MIT · 权重+tokenizer+提示词编码+最小推理全放 · HuggingFace 获赞 437、下载近 1.8 万(截至 09-02)· 基座 0731 三十天 456 万下载
· 本地:GGUF 78.6GB 纯 CPU 可跑 · DGX Spark 现成方案 · vLLM/SGLang/Unsloth 已跟进 · 避坑:HF 上的 0731-vision 是社区 LoRA 非官方权重
来源:
· 官方公告:api-docs.deepseek.com/news/news260821
· 模型卡与权重:huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
· 定价与 API 文档:api-docs.deepseek.com(pricing / guides/vision)
· 第三方:OpenRouter 模型页调用数据 · GitHub deepseek-harness releases
· 参数量与开放时间为 HF/GitHub 实测(截至 2026-09-01)
数据与基准均来自官方页面与权重实测并逐项核对。
BGM:Digital Clouds(Mixkit,Mixkit License,免署名)。
如有不准确之处,欢迎指出。
Comments
ds终于有多模态了[妙啊]
♥ 2
识个图,用了4块多[doge],化工的 pid 图纸,只识了一张
↩ 1
我还以为能生图了呢