从国产SOTA走向世界SOTA? GLM-5.1 实测!
合集 · 大模型竞技场 (77)
-
全网首测!DeepSeek 4 小时之前又发布了一个多模态模型 Janus-pro
1:40
-
5分钟教你使用AI写一个风扇控制器
4:24
-
10小时前发布的大模型 Mistral-small-24B 马上开测!
2:46
-
NVIDIA又要跌?DeepSeek 刚用 FP8 没多久,这 FP4 训练要来了
0:51
-
一招解决DeepSeek-R1无法连接网络问题!还能白嫖DeepSeek-R1!
1:43
-
国产视频生成框架!能让老黄唱野狼 Disco!
1:17
-
大模型竞技场 - Gemini-2.0-Flash 全网首测!
4:03
-
微信刚上线 DeepSeek, 腾讯又把 AI 知识库也接入 DeepSeek 了?
2:10
-
来啦!Grok-3 全网首测!登陆火星 demo!
2:52
-
视觉大模型也能推理了?来看Ovis-2视觉模型的效果如何!
1:55
-
谁是最强写代码模型? 我使用了最好的21个模型, 花了50刀, 总计测试252次
7:32
-
全站最速!DeepSeek-V3-0324 写代码能力评测!不仅 OpenAI, Claude 也要颤抖了
2:06
-
我用AI做了个网页版我的世界,还能用砸瓦鲁多
4:18
-
全站最速!GPT-4.1 写代码能力评测!啊?又拉了?
2:25
-
极限测试!Qwen3 写代码+画画!究竟是不是开源最强模型?
5:53
-
我发现了AI最有用的用途——整理桌面!来看 Kimi-K2 Agent 能力实测!
12:42
-
使用 AI 做了个以《三体》中叶文洁为视角的小短片——三体·独白
2:02
-
nano-banana 幼儿园级教程① 如何将照片转换为城市天际线风格的建筑!
0:37
-
nano-banana 幼儿园教程第②弹! 教你如何做模特图!
1:06
-
nano-banana 幼儿园级教程第③弹! 如何实现贴纸自由!
0:55
-
nano-banana 幼儿园教程第四弹! 教你如何克隆喜欢的图标!
0:46
-
nano-banana 教程第五弹! 如何万物像素化!
0:41
-
nano-banana 生成 8K 分辨率图片教程!
1:10
-
Kimi-K2-0905 实测! 一口气输出1100行代码
3:06
-
Qwen3-Max-Preview 实测! 给大家放个鞭炮
1:41
-
Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗?
2:20
-
刚发布的 Qwen3-TTS-Flash 实测!
1:31
-
DeepSeek-V3.2 实测! 真就只提升了0.1?
2:54
-
Claude-Sonnet-4.5 实测! 口嫌体正直国庆献礼?
2:18
-
GLM-4.6 实测! 最近都很流行更新一大截然后版本就增加0.1嘛?
2:22
-
DeepSeek 竟然是 INTJ, 如果改成 INFP 会怎样?
2:22
-
claude-haiku-4.5 实测! 便宜大碗?
2:05
-
Vibe Coding 不流行了? Spec Coding 教程来啦
2:15
-
KAT-Coder-Pro-V1 实测! 早放3个月就好了?
2:36
-
Minimax M2 实测! 你也晚了3个月?
2:07
-
Cursor 推出炼蛊模式!一口气能开8个代理!
1:16
-
Cursor 终于有自己的大模型啦!来看实测!
2:32
-
Qwen3-Max-Thinking 实测! 呃......
2:28
-
Kimi-K2-Thinking 实测! 差距继续缩小!
2:17
-
Gemini 3.0 Pro 实测! SOTA! 不过发现两个重要问题!
3:17
-
nano banana pro 幼儿园教程! 如何合成橱窗图片!
0:52
-
Meta 的新模型 SAM 3 实测!
4:31
-
什么? 用 Claude Code 剪视频?
2:05
-
DeepSeek V3.2 正式版实测! 提升真的有限?
2:50
-
教程来啦! 如何使用AI打造自媒体博主军火库
2:57
-
GPT-5.2 实测! 美是真的美, 卡是真的卡
2:54
-
一秒生成高斯点云? Apple新模型SHARP实测!
1:25
-
AI送外卖到底有多强? 来看 Doubao-Seed-1.8 Agent 能力评测!
4:38
-
现在都流行大模型月更吗? MiniMax-M2.1 实测!
4:33
-
2025年全球大模型厂商下载量排行榜
3:42
-
500张图片测试! 一个视频告诉你GLM-Image怎么用!
3:27
-
不写 prompt 改看视频了! Kimi-K2.5 实测!
5:58
-
提升明显! Qwen3-Max 正式版 vs Preview版 实测!
4:55
-
不是说好了年前不发吗? DeepSeek 你个大猪蹄子
2:29
-
GLM-5发布啦! 给大家带来实测! 国产大模型正式进入月更节奏!
7:04
-
啊?一个月一个版本? MiniMax-M2.5 4000万 token 实测!
5:06
-
Qwen3.5实测! 来看贺岁档大模型的实力!
7:01
-
Gemini-3.1-pro 实测! 更新了个寂寞?
4:32
-
inclusionAI Ling&Ring 2.5-1T 大模型实测!
5:15
-
Agent 能力有多强? 来看豆包 Seed 2.0 实测!
6:07
-
龙虾专用大模型? GLM-5-Turbo 实测!
5:10
-
如何做一个生产级SKILL? 用MiniMax-M2.7给龙虾写SKILL的保姆教程
3:44
-
从国产SOTA走向世界SOTA? GLM-5.1 实测!
8:01
-
AI能帮我拍照了? Qwen3.5-Omni实测!
6:06
-
花费106刀测试! Claude-Opus-4.7 到底更新了啥?
8:51
-
Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏!
9:04
-
大模型写代码比说话还快是什么体验?
2:32
-
Agentic Coding 能力大幅提升! Qwen3.7-Max实测!
7:36
-
MiniMax-M3 最佳实践? 这个视频告诉你!
5:39
-
Fable 5 超越人类还为时尚早!
1:06
-
单卡 700TPS! Diffusion Gemma 来了!
0:44
-
GLM-5.2实测! 什么才是Agent能力的提升?
5:40
-
2分钟教你做一个可以自我迭代的 Agent
1:43
-
Flash模型横评! 性价比之选竟然是这个?
6:12
-
混元3实测! 300B参数竟然有这种Agent能力!
6:33
-
1B就能达到这种效果?LingBot-Vision实测!
1:13
-
Kimi-K3 全方位实测! 我竟然打游戏输给了她?!
14:05
Description
给大家带来 GLM-5.1 编程能力实测! 本次测试涵盖了前端, 后端, Agent 能力, 前端主要面向空间建模, 场景, 材质, 粒子效果等, 后端能力主要面向数据结构与算法, 体系结构, 性能优化, 内存和并发管理, 性能热点分析与调优, 面向编辑器方向的Agent能力(因为AI要自己改代码). 直接说结论, 本次测试前端方面粒子效果和光影鲜果略有提升, 剩下空间理解(甚至感觉下降了)和前端美学上没看到有什么提升, 只能说是提升了一点点. 但是后端性能上有巨大的提升, GLM-5.1 在我的 vector-db-bench 中直接秀了一手量化, 把原本32bit精度的数据量化到了8bit, 然后使用SIMD实现了一个指令周期内计算32个向量, 在我测试的其他模型中(包括Claude-opus-4.6, GPT-5.4-Pro(xhigh)) 都没有实现, 直接来到了榜首. 另外Agent能力上也有不小的提升, 同样是我写的让大模型模拟送外卖的硅基骑手测试, 其他大模型的优化还停留在看一个店能不能取两单上, GLM-5.1 已经优化到了我送餐的顺路还能再接一单, 并且仅用了大概GLM-5 1/4的 token 用量就超越了 GLM-5 的测试总分. 当然本次测试过程也很坎坷, 首先是我周末抢了2天都没抢到 coding plan (目前只有coding plan 能用这个模型), 我最后找智谱的同学给我开了个权限. 以及测试中发现白天API不是很稳定, 偶尔输出速度会掉到10tps, 以及会出现乱码文字(我的规避方法是让它输出英文, 然后再找个便宜模型翻译过来). 总结, 各位前端同学估计会失望, 因为无论是从工程还是页面效果上都看不到提升, 甚至可能会有点倒退, 但果写后端代码或者复杂Agent应用可以试试这个新模型, 会有很大的提升.
Comments
glm还是太不稳定了 上下文长度也是硬伤 很考验使用者的水平 opus系列是超跑 glm是改装车 速度可能不会差太多 但是想开好还是困难[doge]
♥ 123 ↩ 6
glm的coding plan根本抢不到,这种饥饿营销太过分了。更夸张的是,我去买了国外一个月的lite,卡的不行。然后就是lite的额度消耗的很快。总结就是现在等于你想用买不到plan,你买了plan你卡的不行,你不卡额度消耗巨快。大家都承认glm写代码好,但是你说这玩意儿再强,这样子也没用啊。
♥ 102 ↩ 44
我从copilot的最初自动补全的时代一直玩ai辅助编程玩到现在的agent时代,最充分的感受就是,实用场景/工作场景/大项目场景,模型能力有一个阈值,超过阈值之后就够用了,更强的能力是在模糊性决策上的锦上添花,以及对agent工具箱的操作能力之类的,属于一些边界上的拓宽。但,那些所谓某某模型这不行那不行的,还有说什么一轮对话几个小时一个bug都修不好,本质上都是提示词都不会好好写,系统框架设计也没做好,软件底层设施混乱导致模型找不到切入点,自己代码的边界条件都控制不好的人,被顶尖模型惯坏了,已经对自己代码失控了,那可不就看什么模型都觉得不行。我现在个人项目和公司项目,主力模型就俩,一个minimax2.5(最近变成2.7了),一个gemini-flash,对甚至我都没兴趣用pro,感觉不出区别,反正都能良好完成任务。
♥ 54 ↩ 13
真实
♥ 43 ↩ 3
[doge]这个模型如果解决了上下文过长之后发癫的问题就是目前开源最强编程模型了
♥ 41 ↩ 13
牙医哥,你啥时候也开始吃民族情绪流量了?看一下你xhs评论区吧,大家都是有目共睹的,这样吹实在没有意义,现在只用一个窄域Bench就敢说全球SOTA了?你当时批评Llama4的客观呢?前段时间Mimo V2 Pro和M2.7,在没法刷榜的Livebench和nao的榜上都是一坨,现在的国模有一个算一个,全是刷榜王 5.4是最近为数不多全面提升的模型了,4.6 opus也是毫无短板的全面SOTA,也没有等到你的视频,真没想到,M2.7这种挤牙膏,毫无亮点的小模型也能有自己独立的介绍视频[笑哭],这些断档领先的SOTA模型做的case绝对比M2.7更有流量吧?
♥ 30 ↩ 16
真的我觉得有的老铁看不惯我测试这个结论想喷我都没喷对地方, 我来给你们提供弹药集火我自己,你其实可以喷 "你测 GPT 用的 openrouter API 有问题, 应该用 OpenAI 官方的" 我会立刻360度转体认输.
♥ 23 ↩ 6
我买了个阿里的coding plan,只有kimi2.5能正常工作(虽然蠢点,但你叫他改几次还是能够用的),千问那是括号都扩不对位置!经典给我把括号打在外面,或者多打括号,导致项目不运行都报语法错误,minmax老是偷偷改一些与我需求不相关的东西,也不跟我反馈,glm5骗了我无数次(明明有的东西他说没有!我给他提示,我说这个东西有,他才道歉说不好意思,我刚刚看错了!这种情况出现了不知道多少次[笑哭])
♥ 18 ↩ 8
你一定是用白天的GLM5.1测试的[吃瓜]
♥ 17 ↩ 1
我感觉和codex 5.4区别很大,最近用glm+cc做很多问题,同样情况下智力程度和codex没法比,比如科研上一些任务,就是配环境,跑代码,修bug,需要很大的人为介入和判断,但是codex几乎可以一句话全自动搞完
♥ 17 ↩ 11
这个模型知乎的一位测试很专业的答主也给了很高的评价。
♥ 16 ↩ 14
跑分很强,但是算力不够,商业落地就是不如国外,这个没办法,毕竟实验室里的东西再强也得工程化才能给大家用
♥ 14 ↩ 5
你的测试集不会已经被GLM学习了吧?完了完了完了。
♥ 13 ↩ 2
你们都是clm这么强,我开的max四百多的套餐,测了几个实际项目中的开发问题,感觉一眼难尽,同样的提示词,同样的代码gpt5.4基本都是一把过,智谱的要调整好几轮,还不一定能改好,而且速度实在太慢了。
♥ 13 ↩ 3
超sonnet我信。超opus真不信
♥ 11 ↩ 6
一句话总结glm5吧,vibe一个最基本的crud基础设施,不带业务那种,可以完成,但是一旦带上业务,需要工程化,例如可拓展,易追踪,可视化,直接崩溃,甚至尝试逐步集成新功能都做不到,会产出屎山代码,逻辑错误,各种不一致的代码,甚至还有空实现,if true返回true这种情况都会出现,这种情况下你和我说glm5.1有多强,我是不信的,前端打不过一年前3.5sonnet,后端和copilot平台降智的3.5sonnet差不多
♥ 10 ↩ 2
只要你是用来挣钱的,一律用OPUS,如果玩玩的,无所谓,用真金白银支持过GLM,效果不满意
♥ 8 ↩ 1
qwen3.6plus来了[滑稽]测测吧
♥ 8 ↩ 2
图片都识别不了
♥ 7 ↩ 1