GLM-5发布啦! 给大家带来实测! 国产大模型正式进入月更节奏!
合集 · 大模型竞技场 (78)
-
全网首测!DeepSeek 4 小时之前又发布了一个多模态模型 Janus-pro
1:40
-
5分钟教你使用AI写一个风扇控制器
4:24
-
10小时前发布的大模型 Mistral-small-24B 马上开测!
2:46
-
NVIDIA又要跌?DeepSeek 刚用 FP8 没多久,这 FP4 训练要来了
0:51
-
一招解决DeepSeek-R1无法连接网络问题!还能白嫖DeepSeek-R1!
1:43
-
国产视频生成框架!能让老黄唱野狼 Disco!
1:17
-
大模型竞技场 - Gemini-2.0-Flash 全网首测!
4:03
-
微信刚上线 DeepSeek, 腾讯又把 AI 知识库也接入 DeepSeek 了?
2:10
-
来啦!Grok-3 全网首测!登陆火星 demo!
2:52
-
视觉大模型也能推理了?来看Ovis-2视觉模型的效果如何!
1:55
-
谁是最强写代码模型? 我使用了最好的21个模型, 花了50刀, 总计测试252次
7:32
-
全站最速!DeepSeek-V3-0324 写代码能力评测!不仅 OpenAI, Claude 也要颤抖了
2:06
-
我用AI做了个网页版我的世界,还能用砸瓦鲁多
4:18
-
全站最速!GPT-4.1 写代码能力评测!啊?又拉了?
2:25
-
极限测试!Qwen3 写代码+画画!究竟是不是开源最强模型?
5:53
-
我发现了AI最有用的用途——整理桌面!来看 Kimi-K2 Agent 能力实测!
12:42
-
使用 AI 做了个以《三体》中叶文洁为视角的小短片——三体·独白
2:02
-
nano-banana 幼儿园级教程① 如何将照片转换为城市天际线风格的建筑!
0:37
-
nano-banana 幼儿园教程第②弹! 教你如何做模特图!
1:06
-
nano-banana 幼儿园级教程第③弹! 如何实现贴纸自由!
0:55
-
nano-banana 幼儿园教程第四弹! 教你如何克隆喜欢的图标!
0:46
-
nano-banana 教程第五弹! 如何万物像素化!
0:41
-
nano-banana 生成 8K 分辨率图片教程!
1:10
-
Kimi-K2-0905 实测! 一口气输出1100行代码
3:06
-
Qwen3-Max-Preview 实测! 给大家放个鞭炮
1:41
-
Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗?
2:20
-
刚发布的 Qwen3-TTS-Flash 实测!
1:31
-
DeepSeek-V3.2 实测! 真就只提升了0.1?
2:54
-
Claude-Sonnet-4.5 实测! 口嫌体正直国庆献礼?
2:18
-
GLM-4.6 实测! 最近都很流行更新一大截然后版本就增加0.1嘛?
2:22
-
DeepSeek 竟然是 INTJ, 如果改成 INFP 会怎样?
2:22
-
claude-haiku-4.5 实测! 便宜大碗?
2:05
-
Vibe Coding 不流行了? Spec Coding 教程来啦
2:15
-
KAT-Coder-Pro-V1 实测! 早放3个月就好了?
2:36
-
Minimax M2 实测! 你也晚了3个月?
2:07
-
Cursor 推出炼蛊模式!一口气能开8个代理!
1:16
-
Cursor 终于有自己的大模型啦!来看实测!
2:32
-
Qwen3-Max-Thinking 实测! 呃......
2:28
-
Kimi-K2-Thinking 实测! 差距继续缩小!
2:17
-
Gemini 3.0 Pro 实测! SOTA! 不过发现两个重要问题!
3:17
-
nano banana pro 幼儿园教程! 如何合成橱窗图片!
0:52
-
Meta 的新模型 SAM 3 实测!
4:31
-
什么? 用 Claude Code 剪视频?
2:05
-
DeepSeek V3.2 正式版实测! 提升真的有限?
2:50
-
教程来啦! 如何使用AI打造自媒体博主军火库
2:57
-
GPT-5.2 实测! 美是真的美, 卡是真的卡
2:54
-
一秒生成高斯点云? Apple新模型SHARP实测!
1:25
-
AI送外卖到底有多强? 来看 Doubao-Seed-1.8 Agent 能力评测!
4:38
-
现在都流行大模型月更吗? MiniMax-M2.1 实测!
4:33
-
2025年全球大模型厂商下载量排行榜
3:42
-
500张图片测试! 一个视频告诉你GLM-Image怎么用!
3:27
-
不写 prompt 改看视频了! Kimi-K2.5 实测!
5:58
-
提升明显! Qwen3-Max 正式版 vs Preview版 实测!
4:55
-
不是说好了年前不发吗? DeepSeek 你个大猪蹄子
2:29
-
GLM-5发布啦! 给大家带来实测! 国产大模型正式进入月更节奏!
7:04
-
啊?一个月一个版本? MiniMax-M2.5 4000万 token 实测!
5:06
-
Qwen3.5实测! 来看贺岁档大模型的实力!
7:01
-
Gemini-3.1-pro 实测! 更新了个寂寞?
4:32
-
inclusionAI Ling&Ring 2.5-1T 大模型实测!
5:15
-
Agent 能力有多强? 来看豆包 Seed 2.0 实测!
6:07
-
龙虾专用大模型? GLM-5-Turbo 实测!
5:10
-
如何做一个生产级SKILL? 用MiniMax-M2.7给龙虾写SKILL的保姆教程
3:44
-
从国产SOTA走向世界SOTA? GLM-5.1 实测!
8:01
-
AI能帮我拍照了? Qwen3.5-Omni实测!
6:06
-
花费106刀测试! Claude-Opus-4.7 到底更新了啥?
8:51
-
Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏!
9:04
-
大模型写代码比说话还快是什么体验?
2:32
-
Agentic Coding 能力大幅提升! Qwen3.7-Max实测!
7:36
-
MiniMax-M3 最佳实践? 这个视频告诉你!
5:39
-
Fable 5 超越人类还为时尚早!
1:06
-
单卡 700TPS! Diffusion Gemma 来了!
0:44
-
GLM-5.2实测! 什么才是Agent能力的提升?
5:40
-
2分钟教你做一个可以自我迭代的 Agent
1:43
-
Flash模型横评! 性价比之选竟然是这个?
6:12
-
混元3实测! 300B参数竟然有这种Agent能力!
6:33
-
1B就能达到这种效果?LingBot-Vision实测!
1:13
-
Kimi-K3 全方位实测! 我竟然打游戏输给了她?!
14:05
-
我用 LongCat-2.0 省了 88% 的 Agent 输入成本!
4:57
Description
GLM-4.7 才发布一个月, 智谱又掏出了 GLM-5, 这迭代速度属实离谱. 照例给大家带来编程、Agent、长上下文能力全面测试!
本次编程能力提升巨大: 新引入的鞭炮炸鱼缸测试, 要求模拟水滴/碎屑/烟雾/气泡四种粒子效果混合在流体中, 折射效果还原度已经和 Claude Opus 4.6 几乎没区别了. 鞭炮连锁爆炸测试指令遵循大幅提升, GLM-4.7 会忽略的参数 GLM-5 都能精准还原, 视觉上玻璃箱效果、色调映射达到了电影级画质. Python 杯子倒水新增了顶点碰撞检测, 甚至给2D粒子加了模拟3D高光! 大象牙膏测试实现了三层碰撞检测, 引入动画阶段机制精准还原 prompt 要求. 陀飞轮机芯也是一眼可见的提升.
Agent 能力再次刷新纪录: 硅基骑手测试 (这次订单量加了5倍!) GLM-5 拿到 ¥738.69, 对比 GLM-4.7 的 ¥571.91. 关键发现是, GLM-5 每轮对话都在跟踪剩余轮次 ("254/300, 还有46轮"), 这种元认知是 GLM-4.7 未有过的. 它甚至给自己定了个小目标 "突破700元大关", 达成后庆祝了一下就继续干活. 而 GLM-4.7 在第198轮就开香槟不干了...
长文本召回: 各长度上下文召回均 98% 以上, 但有个问题 - 不给原文时四选一蒙对率达到 51.4%, 模型甚至能脑补出哈利波特小说英文原文, 所以分数置信度存疑. 不过 Agent 测试本身上下文就超过 100K, 召回性能实际上没问题.
总结: GLM-5 编程全面进化, Agent 能力展现出自主规划意识, 视觉美学也显著提升 (这次它特别偏爱科技感的 Orbitron 字体). 这么猛的表现, 很期待接下来的 GLM-5V!
另外官方账号还发了个马的图案, 看来之前的 pony alpha 是 GLM-5 石锤了!
(P.S. 本次测试的是内测版本)
Comments
想看后端编码能力,前端已经被玩烂了
♥ 121 ↩ 23
我自己简单测了一下感觉这次更新还可以吧,不排除以后降智,主要是这次期待很久的deepseek更新只是增加上下文反而稍微降智! GLM5基本是和KIMI2.5打个有来有回,都算是国产模型的中流砥柱了
♥ 61 ↩ 13
接着还有 minimax m2.5[doge]
♥ 42 ↩ 2
这个模型知识库还在24年5月,和glm4.x系列一模一样。说明了什么,智谱根本就没在后训练上用心,全去搞RL增强agent能力了。 但事实上,参数扩大,数据集不变的结果大家都懂,过拟合。我相信agent和编码不会过度拉胯,但真的对得起大了一倍的参数吗? 我的感觉是实测和4.7没有明显差距,该发懵的地方还是会发懵。 实际工程中比起所谓的逻辑能力更需要基础知识,模型不仅需要会规划还需要知道api怎么用,出了奇怪bug怎么排查,这方面,我敢相信glm5一定退步了。。。 期待qwen3.5ing
♥ 38 ↩ 23
等一个月后会不会降智在考虑,目前太多人被坑了[笑哭]
♥ 30 ↩ 2
我觉得这次更新有点太急躁了,glm5个人感觉没比glm4.7强太多但显著贵。是不是登陆资本市场都这么个操作。国内大模型企业能不能像deepseek一样关注点有意义的进步,同时关注解决实际问题,而不是照着benchmark微调模型就发一版?现在搞得模型就是一个背八股很牛逼一到解决问题就拉胯的状况。希望qwen3.5能给点不一样的感觉。
♥ 25 ↩ 2
不和codex5.3比是因为太超模了吗,codex这把真的赢麻了,价格低还好用
♥ 21 ↩ 12
glm已涨价,最高套餐才能用到glm5[藏狐]
♥ 20 ↩ 3
我去 真平替sonnet4.5
♥ 18 ↩ 31
打榜无敌,上手拉胯[doge]
♥ 17 ↩ 6
GLM5的性能刚刚赶上k2.5而已,但是隔壁k2.5默不作声,一点垃圾营销不整,使用体验极佳(token生成速度快多了,而且准确度相当好) 反倒是智谱,卖的贵,资源少,性能烂,还摆谱。无语了
♥ 14 ↩ 2
自我認同這一塊[笑哭]
♥ 13 ↩ 13
22m上下文?还是消耗了22m token[喜极而泣]
♥ 13 ↩ 1
感觉几家都有点赶时间节点的意思, 又或许是被2.5吓到了[doge_金箍][doge_金箍][doge_金箍]
♥ 13
我有一个疑问:如果某个 AI API 服务商在订阅方案中承诺更高的使用额度,比如每 5 小时 500 次调用,但在实际服务中却不允许并发请求,而且 token per second 的限制很低,导致即使满负荷运行 5 小时也无法完成 500 次调用,这种情况是否可能构成商业欺诈?[doge]
♥ 9 ↩ 1
对比了GLM-5和Kimi K2.5的Benchmark表现以及技术架构: 🚀在性能表现方面,除了多模态能力GLM-5弱于Kimi K2.5以外,其它方面均领先,其中Agent与编程能力领先明显。 🖼️技术架构上Kimi K2.5参数规模更大,原生多模态,上下文更长以及Agent Swarm(并行智能体)创新,在消费端、办公日常方面体验上更强。 👀可以看出GLM已经将目标用户人群定位于程序员、生产端,这个路线定位与Claude类似。 ❗结论: 1.如果你的工作重点是代码生成、Agent自动化、长期任务规划,选择GLM-5; 2.如果需要原生多模态处理、更好的日常场景任务支持、并行智能体协作,选择Kimi K2.5。
♥ 9
拉倒吧,之前 glm4.7 也吹上天,实际表现蠢得我难受
♥ 8 ↩ 4
谨慎看好,最近这几个宣传有点太狠了。 glm,Kimi,qwen,排行榜测评全是拳打gemini,脚踢Claude。 最后还是用codex和opus解决问题。
♥ 7 ↩ 7
lite没有。而且,为什么涨了这么多,前几天我看才20
♥ 6 ↩ 3
有DeepSeek的新模型,谁还管这个牛夫人
♥ 6 ↩ 10