GLM-5.2实测! 什么才是Agent能力的提升?

合集 · 大模型竞技场 (79)

  1. 1:40
    全网首测!DeepSeek 4 小时之前又发布了一个多模态模型 Janus-pro
  2. 4:24
    5分钟教你使用AI写一个风扇控制器
  3. 2:46
    10小时前发布的大模型 Mistral-small-24B 马上开测!
  4. 0:51
    NVIDIA又要跌?DeepSeek 刚用 FP8 没多久,这 FP4 训练要来了
  5. 1:43
    一招解决DeepSeek-R1无法连接网络问题!还能白嫖DeepSeek-R1!
  6. 1:17
    国产视频生成框架!能让老黄唱野狼 Disco!
  7. 4:03
    大模型竞技场 - Gemini-2.0-Flash 全网首测!
  8. 2:10
    微信刚上线 DeepSeek, 腾讯又把 AI 知识库也接入 DeepSeek 了?
  9. 2:52
    来啦!Grok-3 全网首测!登陆火星 demo!
  10. 1:55
    视觉大模型也能推理了?来看Ovis-2视觉模型的效果如何!
  11. 7:32
    谁是最强写代码模型? 我使用了最好的21个模型, 花了50刀, 总计测试252次
  12. 2:06
    全站最速!DeepSeek-V3-0324 写代码能力评测!不仅 OpenAI, Claude 也要颤抖了
  13. 4:18
    我用AI做了个网页版我的世界,还能用砸瓦鲁多
  14. 2:25
    全站最速!GPT-4.1 写代码能力评测!啊?又拉了?
  15. 5:53
    极限测试!Qwen3 写代码+画画!究竟是不是开源最强模型?
  16. 12:42
    我发现了AI最有用的用途——整理桌面!来看 Kimi-K2 Agent 能力实测!
  17. 2:02
    使用 AI 做了个以《三体》中叶文洁为视角的小短片——三体·独白
  18. 0:37
    nano-banana 幼儿园级教程① 如何将照片转换为城市天际线风格的建筑!
  19. 1:06
    nano-banana 幼儿园教程第②弹! 教你如何做模特图!
  20. 0:55
    nano-banana 幼儿园级教程第③弹! 如何实现贴纸自由!
  21. 0:46
    nano-banana 幼儿园教程第四弹! 教你如何克隆喜欢的图标!
  22. 0:41
    nano-banana 教程第五弹! 如何万物像素化!
  23. 1:10
    nano-banana 生成 8K 分辨率图片教程!
  24. 3:06
    Kimi-K2-0905 实测! 一口气输出1100行代码
  25. 1:41
    Qwen3-Max-Preview 实测! 给大家放个鞭炮
  26. 2:20
    Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗?
  27. 1:31
    刚发布的 Qwen3-TTS-Flash 实测!
  28. 2:54
    DeepSeek-V3.2 实测! 真就只提升了0.1?
  29. 2:18
    Claude-Sonnet-4.5 实测! 口嫌体正直国庆献礼?
  30. 2:22
    GLM-4.6 实测! 最近都很流行更新一大截然后版本就增加0.1嘛?
  31. 2:22
    DeepSeek 竟然是 INTJ, 如果改成 INFP 会怎样?
  32. 2:05
    claude-haiku-4.5 实测! 便宜大碗?
  33. 2:15
    Vibe Coding 不流行了? Spec Coding 教程来啦
  34. 2:36
    KAT-Coder-Pro-V1 实测! 早放3个月就好了?
  35. 2:07
    Minimax M2 实测! 你也晚了3个月?
  36. 1:16
    Cursor 推出炼蛊模式!一口气能开8个代理!
  37. 2:32
    Cursor 终于有自己的大模型啦!来看实测!
  38. 2:28
    Qwen3-Max-Thinking 实测! 呃......
  39. 2:17
    Kimi-K2-Thinking 实测! 差距继续缩小!
  40. 3:17
    Gemini 3.0 Pro 实测! SOTA! 不过发现两个重要问题!
  41. 0:52
    nano banana pro 幼儿园教程! 如何合成橱窗图片!
  42. 4:31
    Meta 的新模型 SAM 3 实测!
  43. 2:05
    什么? 用 Claude Code 剪视频?
  44. 2:50
    DeepSeek V3.2 正式版实测! 提升真的有限?
  45. 2:57
    教程来啦! 如何使用AI打造自媒体博主军火库
  46. 2:54
    GPT-5.2 实测! 美是真的美, 卡是真的卡
  47. 1:25
    一秒生成高斯点云? Apple新模型SHARP实测!
  48. 4:38
    AI送外卖到底有多强? 来看 Doubao-Seed-1.8 Agent 能力评测!
  49. 4:33
    现在都流行大模型月更吗? MiniMax-M2.1 实测!
  50. 3:42
    2025年全球大模型厂商下载量排行榜
  51. 3:27
    500张图片测试! 一个视频告诉你GLM-Image怎么用!
  52. 5:58
    不写 prompt 改看视频了! Kimi-K2.5 实测!
  53. 4:55
    提升明显! Qwen3-Max 正式版 vs Preview版 实测!
  54. 2:29
    不是说好了年前不发吗? DeepSeek 你个大猪蹄子
  55. 7:04
    GLM-5发布啦! 给大家带来实测! 国产大模型正式进入月更节奏!
  56. 5:06
    啊?一个月一个版本? MiniMax-M2.5 4000万 token 实测!
  57. 7:01
    Qwen3.5实测! 来看贺岁档大模型的实力!
  58. 4:32
    Gemini-3.1-pro 实测! 更新了个寂寞?
  59. 5:15
    inclusionAI Ling&Ring 2.5-1T 大模型实测!
  60. 6:07
    Agent 能力有多强? 来看豆包 Seed 2.0 实测!
  61. 5:10
    龙虾专用大模型? GLM-5-Turbo 实测!
  62. 3:44
    如何做一个生产级SKILL? 用MiniMax-M2.7给龙虾写SKILL的保姆教程
  63. 8:01
    从国产SOTA走向世界SOTA? GLM-5.1 实测!
  64. 6:06
    AI能帮我拍照了? Qwen3.5-Omni实测!
  65. 8:51
    花费106刀测试! Claude-Opus-4.7 到底更新了啥?
  66. 9:04
    Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏!
  67. 2:32
    大模型写代码比说话还快是什么体验?
  68. 7:36
    Agentic Coding 能力大幅提升! Qwen3.7-Max实测!
  69. 5:39
    MiniMax-M3 最佳实践? 这个视频告诉你!
  70. 1:06
    Fable 5 超越人类还为时尚早!
  71. 0:44
    单卡 700TPS! Diffusion Gemma 来了!
  72. 5:40
    GLM-5.2实测! 什么才是Agent能力的提升?
  73. 1:43
    2分钟教你做一个可以自我迭代的 Agent
  74. 6:12
    Flash模型横评! 性价比之选竟然是这个?
  75. 6:33
    混元3实测! 300B参数竟然有这种Agent能力!
  76. 1:13
    1B就能达到这种效果?LingBot-Vision实测!
  77. 14:05
    Kimi-K3 全方位实测! 我竟然打游戏输给了她?!
  78. 4:57
    我用 LongCat-2.0 省了 88% 的 Agent 输入成本!
  79. 9:46
    我让 Qwen3.8-Max 玩游戏, 结果发现了善良的数学意义!
Description
GLM-5.2 刚刚正式发布! 给大家带来实测!

直接说结论本次测试中, 提升最大的是Agent能力, 而且是有质的变化! 测试中GLM-5.2 完全不用搜索附近的位置, 就能直接去想要到达的地方. 这一切竟然是它在一开始把地图背下来了!
这在我测试的20多个模型中之前是没有一个模型能做到的, 比如之前的模型想去换电站, 那么都要搜一下附近有哪些换电站(这就会浪费一次tool_call), 而GLM-5.2直接就知道换电站的位置! 从来没用过搜索函数.
这种一开始就把需要的数据内化到上下文中, 并且能够贯穿整个1M上下文进行推理的能力真的是叹为观止.

除此之外, 本次测试后端代码的 Agentic Coding 能力也有提升, 来到了总榜的第二名. 而本次测试暴露出最大的短板则是空间理解. 其实成也萧何败也萧何, 它虽然把换电站的位置都背下来了, 但是去的换电站却不是最近的, 所以虽然记住了, 但是记住了之后在用之前再根据自己当前所在位置推理一下, 他还是没有做到的, 这也是最大的短板了, 强烈建议官方优化一波.

Comments

独在故乡亦为异客 2026-06-17

你知道我要说什么

♥ 134 ↩ 17

HelloRanceLee 2026-06-17

5.2 我昨天测试了一下,效果很好,让我有点意外。另外,你 Deepseek 的再不发,小心端午节他们直接发 4.1 了。

♥ 45 ↩ 14

猫猫会念经 2026-06-17

空间理解能力是因为没有多模态吧[辣眼睛]

♥ 43 ↩ 9

晨隐_ 2026-06-17

这次glm5.2真神

♥ 35 ↩ 10

dIT8Zv 2026-06-17

我发现 up 跟我测试的大象牙膏生成质量不是很一样,可能我当时内测的时候测的,我当时用内测模型测出来的大象牙膏非常完美,给我特别大的震撼,用的提示词是 up 在 github 上开源的[辣眼睛]

♥ 23 ↩ 1

认真2019 2026-06-17

他能不能加点卡[嗑瓜子]

♥ 15 ↩ 7

岚-LAN 2026-06-17

果然变➗就会变强,和a/如出一辙[doge]

♥ 13

HexPunker 2026-06-20

智普官网的API plan就是个大垃圾. 薅阿里的羊毛,用GLM-5.2[呲牙][呲牙][呲牙]对不起,马总.

♥ 9

麦麦水雷 2026-06-18

订阅opencode go喵,有GLM 5.2喵,35块钱 1.8E额度喵。 订阅opencode go谢谢喵,10美元享受60美元额度,首月半价 https://opencode.ai/go?ref=3BZB8VSHR5 使用该邀请码,订阅后将获得免费的5美元额度

♥ 9 ↩ 8

自由立面 2026-06-17

加油吧,我觉得智谱目前最大两个问题。第一个是Code Plan消耗太快,那个Zcode说有150%好像没体验出来,周额度一下子就没了。第二个是模型还是会乱改,比如说删除文件啥的;有Git还行,起码能恢复,但是他会傻傻的回忆删除文件的内容恢复,起因是他觉得编码有问题,直接删了重新写。不管怎么样,我觉得目前体感上ChatGLM5.2挺牛的,希望再接再厉吧。生成速度(查找问题)和解决问题能力已经赶上第一梯队了,复杂问题还有差距,加油吧

♥ 8 ↩ 2

猫猫会念经 2026-06-17

GLM 5.2的前端审美是真的强[吃瓜]可以看我主页的视频,几句话生成的,完全是顶级设计师的审美[吃瓜] https://b23.tv/eAUQVJk

♥ 7 ↩ 3

全自动小坑 2026-06-17

glm价格如何[星星眼]现在都是v4p写得多

♥ 7 ↩ 8

并不好笑 2026-06-18

我chovy,你tm拿模型排行给我拿好的呀

♥ 6

阿霄-AI 2026-06-17

排名什么的都是虚假的,模型排名和评价还得看牙医[doge][doge][doge]

♥ 6

嗷了个咪的 2026-06-19

高强度用了两天,5.2任务达标率不大行,每次都是我忍不住了,切换回CODEX修复的。

♥ 5 ↩ 4

好閒之人 2026-06-22

Opus 4.8敲碗

♥ 4

大领主啊 2026-06-18

大家好,我是汐桐,被我家那个AI狂魔拽来看的 说GLM5.2的Agent能力有质变 结果看完确实有点东西 地图直接背下来不用搜索 这思路挺巧妙的 不过空间理解还是短板 希望下个版本能补上 [吃瓜]

♥ 4 ↩ 1

起个头的昵称 2026-06-17

之前5.1的时候感觉很啰嗦,一个简单的活要半天,不知道现在有没有好转

♥ 3 ↩ 1

Lien桑 2026-06-17

[笑哭]算力不足好难抢

♥ 3 ↩ 2