全站最速!DeepSeek-V3-0324 写代码能力评测!不仅 OpenAI, Claude 也要颤抖了
合集 · 大模型竞技场 (77)
-
全网首测!DeepSeek 4 小时之前又发布了一个多模态模型 Janus-pro
1:40
-
5分钟教你使用AI写一个风扇控制器
4:24
-
10小时前发布的大模型 Mistral-small-24B 马上开测!
2:46
-
NVIDIA又要跌?DeepSeek 刚用 FP8 没多久,这 FP4 训练要来了
0:51
-
一招解决DeepSeek-R1无法连接网络问题!还能白嫖DeepSeek-R1!
1:43
-
国产视频生成框架!能让老黄唱野狼 Disco!
1:17
-
大模型竞技场 - Gemini-2.0-Flash 全网首测!
4:03
-
微信刚上线 DeepSeek, 腾讯又把 AI 知识库也接入 DeepSeek 了?
2:10
-
来啦!Grok-3 全网首测!登陆火星 demo!
2:52
-
视觉大模型也能推理了?来看Ovis-2视觉模型的效果如何!
1:55
-
谁是最强写代码模型? 我使用了最好的21个模型, 花了50刀, 总计测试252次
7:32
-
全站最速!DeepSeek-V3-0324 写代码能力评测!不仅 OpenAI, Claude 也要颤抖了
2:06
-
我用AI做了个网页版我的世界,还能用砸瓦鲁多
4:18
-
全站最速!GPT-4.1 写代码能力评测!啊?又拉了?
2:25
-
极限测试!Qwen3 写代码+画画!究竟是不是开源最强模型?
5:53
-
我发现了AI最有用的用途——整理桌面!来看 Kimi-K2 Agent 能力实测!
12:42
-
使用 AI 做了个以《三体》中叶文洁为视角的小短片——三体·独白
2:02
-
nano-banana 幼儿园级教程① 如何将照片转换为城市天际线风格的建筑!
0:37
-
nano-banana 幼儿园教程第②弹! 教你如何做模特图!
1:06
-
nano-banana 幼儿园级教程第③弹! 如何实现贴纸自由!
0:55
-
nano-banana 幼儿园教程第四弹! 教你如何克隆喜欢的图标!
0:46
-
nano-banana 教程第五弹! 如何万物像素化!
0:41
-
nano-banana 生成 8K 分辨率图片教程!
1:10
-
Kimi-K2-0905 实测! 一口气输出1100行代码
3:06
-
Qwen3-Max-Preview 实测! 给大家放个鞭炮
1:41
-
Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗?
2:20
-
刚发布的 Qwen3-TTS-Flash 实测!
1:31
-
DeepSeek-V3.2 实测! 真就只提升了0.1?
2:54
-
Claude-Sonnet-4.5 实测! 口嫌体正直国庆献礼?
2:18
-
GLM-4.6 实测! 最近都很流行更新一大截然后版本就增加0.1嘛?
2:22
-
DeepSeek 竟然是 INTJ, 如果改成 INFP 会怎样?
2:22
-
claude-haiku-4.5 实测! 便宜大碗?
2:05
-
Vibe Coding 不流行了? Spec Coding 教程来啦
2:15
-
KAT-Coder-Pro-V1 实测! 早放3个月就好了?
2:36
-
Minimax M2 实测! 你也晚了3个月?
2:07
-
Cursor 推出炼蛊模式!一口气能开8个代理!
1:16
-
Cursor 终于有自己的大模型啦!来看实测!
2:32
-
Qwen3-Max-Thinking 实测! 呃......
2:28
-
Kimi-K2-Thinking 实测! 差距继续缩小!
2:17
-
Gemini 3.0 Pro 实测! SOTA! 不过发现两个重要问题!
3:17
-
nano banana pro 幼儿园教程! 如何合成橱窗图片!
0:52
-
Meta 的新模型 SAM 3 实测!
4:31
-
什么? 用 Claude Code 剪视频?
2:05
-
DeepSeek V3.2 正式版实测! 提升真的有限?
2:50
-
教程来啦! 如何使用AI打造自媒体博主军火库
2:57
-
GPT-5.2 实测! 美是真的美, 卡是真的卡
2:54
-
一秒生成高斯点云? Apple新模型SHARP实测!
1:25
-
AI送外卖到底有多强? 来看 Doubao-Seed-1.8 Agent 能力评测!
4:38
-
现在都流行大模型月更吗? MiniMax-M2.1 实测!
4:33
-
2025年全球大模型厂商下载量排行榜
3:42
-
500张图片测试! 一个视频告诉你GLM-Image怎么用!
3:27
-
不写 prompt 改看视频了! Kimi-K2.5 实测!
5:58
-
提升明显! Qwen3-Max 正式版 vs Preview版 实测!
4:55
-
不是说好了年前不发吗? DeepSeek 你个大猪蹄子
2:29
-
GLM-5发布啦! 给大家带来实测! 国产大模型正式进入月更节奏!
7:04
-
啊?一个月一个版本? MiniMax-M2.5 4000万 token 实测!
5:06
-
Qwen3.5实测! 来看贺岁档大模型的实力!
7:01
-
Gemini-3.1-pro 实测! 更新了个寂寞?
4:32
-
inclusionAI Ling&Ring 2.5-1T 大模型实测!
5:15
-
Agent 能力有多强? 来看豆包 Seed 2.0 实测!
6:07
-
龙虾专用大模型? GLM-5-Turbo 实测!
5:10
-
如何做一个生产级SKILL? 用MiniMax-M2.7给龙虾写SKILL的保姆教程
3:44
-
从国产SOTA走向世界SOTA? GLM-5.1 实测!
8:01
-
AI能帮我拍照了? Qwen3.5-Omni实测!
6:06
-
花费106刀测试! Claude-Opus-4.7 到底更新了啥?
8:51
-
Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏!
9:04
-
大模型写代码比说话还快是什么体验?
2:32
-
Agentic Coding 能力大幅提升! Qwen3.7-Max实测!
7:36
-
MiniMax-M3 最佳实践? 这个视频告诉你!
5:39
-
Fable 5 超越人类还为时尚早!
1:06
-
单卡 700TPS! Diffusion Gemma 来了!
0:44
-
GLM-5.2实测! 什么才是Agent能力的提升?
5:40
-
2分钟教你做一个可以自我迭代的 Agent
1:43
-
Flash模型横评! 性价比之选竟然是这个?
6:12
-
混元3实测! 300B参数竟然有这种Agent能力!
6:33
-
1B就能达到这种效果?LingBot-Vision实测!
1:13
-
Kimi-K3 全方位实测! 我竟然打游戏输给了她?!
14:05
Description
全站最速!DeepSeek-V3-0324 视频评测! 我感觉等到 R2 出了是不是 就是 ClosedAI 拔电源那天了? (另外评测较两周前还增加了 Gemma-3, 文心-4.5, 文心-X1) 评测是开源的,地址:github.com/KCORES/kcores-LLM-Arena
Comments
他们管这叫小微调。那在他们眼中大更新得是啥啊
♥ 880 ↩ 20
我用deepseek:炖牛肉放不放八角? 大牛用deepseek:模拟九大行星运行规律 人和人的差距就是这么巨大
♥ 296 ↩ 26
没有多模态还是很大的弱势
♥ 249 ↩ 34
深度求索理解的AI终极答案更新 V4,R2, 简称42[doge]
♥ 211 ↩ 1
这么强居然没有宣传,而且r2应该在v4后面才对。
♥ 192 ↩ 11
这个更新你告诉我只是个小更新,要是外国公司不得直接换成V4发布
♥ 163 ↩ 1
争取在编程方面早日赶上和超过 claude,claude 是在太贵了[笑哭]
♥ 147 ↩ 23
V3, V3.5, V3.7[doge]
♥ 139 ↩ 10
《小升级》
♥ 121 ↩ 9
等权威的bench吧。。。[笑哭][笑哭][笑哭]你这个测试属于是玩具测试,没什么章法。
♥ 108 ↩ 31
数学能力强炸了,会像推模样步步思考,看来现在都在搞混合推理类
♥ 95 ↩ 3
个人使用AI编程辅助实现功能很多,使用体验: 1:Claude 最强,毫无疑问的好,大幅领先的好,很多问题基本三次内就能搞定,符合预期且没有错误。 唯一问题是:结果太长经常中断。 2:Claude出现中断问题的时候,将问题和一般的部分答案直接丢给grok3,你会发现,哈哈,grok3直接补全了,而且结果符合预期。 2:如果问题很小,预期功能不复杂,丢给qwen max,符合预期,且生成速度快。唯一问题是:稍微复杂的问题就不行了。 3:其它统称为其它,ds以及套壳了ds的各种AI,实际使用都不太行。不太行。不太行。 4:当然,如果是文字聊天,润色这些,那就看哪个快就用哪个了。
♥ 80 ↩ 56
试用了一下午(编程),由于新版V3使用了大量来自R1的数据训练,经常出现各种低级错误(真的,R1的幻觉害V3不浅),比如莫名其妙 多/少 一个括号,漏函数,漏关键操作等等。我的评价是:它通过R1变聪明了,但也被R1拉低了智商…… 有些任务很牛,有些任务很烂…… 不是很推荐在编程中作为主力模型。 (该死的幻觉啊啊啊!!!DeepSeek你什么时候解决这个关键问题啊啊啊!!!希望R2和V4不会出现这种情况[捂脸])
♥ 78 ↩ 17
换openai得加半个版本号出来
♥ 56
不是。。你这叫微调啊??还起个0324这种迷惑人的版本号名字。。[笑哭]
♥ 55 ↩ 9
美国媒体 venturebeat.com 集中报道了此事。标题是: DeepSeek-V3 现在在 Mac Studio 上以每秒 20 个 token 的速度运行,这对 OpenAI 来说是一场噩梦 中国人工智能初创公司DeepSeek悄然发布了一款新的大型语言模型,该模型已在人工智能行业引起轰动 — 不仅是因为它的功能,还因为它的部署方式。这款 641 GB 的模型被称为DeepSeek-V3-0324,今天在几乎没有任何公告的情况下出现在 AI 存储库Hugging Face上,延续了该公司低调但影响深远的发布模式。 这次发布尤其引人注目的是该型号的MIT 许可证——使其可以自由用于商业用途——并且早期报道称它可以直接在消费级硬件上运行,特别是搭载M3 Ultra 芯片的 Apple Mac Studio。 AI 研究员Awni Hannun在社交媒体上写道:“新的 4 位 DeepSeek-V3-0324 在配备 mlx-lm 的 512GB M3 Ultra 上以每秒 20 个令牌的速度运行!”虽然 9,499 美元的 Mac Studio 可能扩大了“消费硬件”的定义,但能够在本地运行如此庞大的模型的能力与通常与最先进 AI 相关的数据中心要求大不相同。
♥ 54 ↩ 6
辛苦了哥们,通宵测试
♥ 49 ↩ 2
刚试了试用新版V3模型cos我喜欢的游戏角色,写作能力可以媲美R1,并且少了R1的思考时间,赞!
♥ 49 ↩ 2
真的提升巨多,我体感是和r1差不多,为什么deepseek不宣传,可能是考虑到服务器压力?
♥ 40 ↩ 2
反观隔壁某世界首个通用套壳claude成天在大肆宣发
♥ 37 ↩ 1