Description
本次测试覆盖了GLM-4.7的编程能力, Agent/ToolCall能力, 长上下文召回能力, 给大家带来刚发布的 GLM 4.7 的测试结果:
考验Agent能力的硅基骑手测试, 简单讲是让大模型使用工具模拟骑手取外卖送餐.
GLM 4.7 在24小时总计300回合的极限送餐中收益达到了 571.91 元, 执行了总计 354 次 tool call, 测试使用了大约 50% 的上下文空间, 直到超过100K后才停止工作.
Agent 测试这次是创了新高, 执行效率特别高, 得益于模型可以在一次会话中发起多个 tool call, 节省了时间并能选择收益最大的方案.
然后是考验长上下文召回能力的霍格沃茨测试, 简单来讲就是在长上下文中, 能否记住上下文并准确的回答问题.
GLM 4.7 在192K以内召回水平在91%到100%区间, 而200K也有95%, 召回效果同样也很不错.
最后再来看编程能力测试上最大的感受是粒子, 建模, 光影效果都有提升, 尤其是空间能力有了巨大的提升. 当然性能问题仍然存在, 希望下个版本着重优化下生成代码的性能问题.
总结, 这次GLM 4.7 在各个方面都有明显的提升, 作为主力编程模型不是问题, LMArena 和 SWE-bench 等编程测试中都取得了开源大模型 SOTA 的水平.
不过还是要说一句, 测试中我发现API速度时快时慢, 是不是因为大家都在用新版本导致的? 希望官方赶紧加机器.
Comments
今天 glm4.7 + cc 开发了一整天,感觉还真不错,每次命令都能比较明确的get到我想做的事情做出来,即使有问题也没遇到过怎么沟通都解决不了的情况。 不过今天工作稍偏后端(前后端混合架构的项目),不知道重前端样式的情况效果如何,但感觉我的场景下,其对生产力提升上和 gpt5.x, claude, gemini3 基本感受不到差距了(
♥ 103 ↩ 29
当时4.6被各种媒体说代码强、国内就用4.6、比肩sonnet4,然而下单以后才发现是gpt5mini水平。已经不敢相信4.7了。 用途是写gazebo仿真以及给cpp查段错误。
♥ 32 ↩ 9
最后一句话才是重点!“赶紧加机器!”
♥ 29
这个模型也不行啊,我试着用它解决一个偶发的 C/C++ 多线程竞态问题,这个问题会间歇性地导致某个自动化测试失败,GLM4.7 挣扎了几次没有解决之后把我的测试改了[笑哭]
♥ 22 ↩ 13
暂时开源领跑了,很有东西。
♥ 15
春节估计发5.0。
♥ 15 ↩ 21
好机会和minimax对上了。现在就deepseek和qwen还慢戳戳[吃瓜]
♥ 15 ↩ 16
到后面不会又削智力吧
♥ 12 ↩ 10
看得出来智谱买了不少推广啊。开了他家的max,跟claude比不了一点。就用了一天就不想用了,退款还贼磨叽,咬死不给你退款,威胁要到12315投诉才给退。这家公司为了上市也是拼了。
♥ 8 ↩ 1
从跑快递看,应该只有281个回合就停止了
♥ 8 ↩ 1
先打赢sonnet4.0再说吧 哦对了,sonnet4.7要发了
♥ 7
实测做逆向时,比glm4.6聪明
♥ 7
这应该是老四样测试大象牙膏鞭炮杯子陀飞轮国产整体完成最好的一个了,不过还需要持续优化。然后就是今天实在太他丫慢了,这么多人用还是机器少了啊
♥ 7
还是喜欢用gemini3,今天第一天用GLM4.7 就遇到了思维链复读的情况,一直在重复的思考中出不来,进入死循环的思考。另一个问题是让改 Java代码,每次改完都有问题,连方法的参数列表类型都没改对,改完还是红的。[捂脸]而且跟他讲了 逻辑背景,他居然还 改出循环依赖。并且给他报错信息让他修复,他也没修复对。
♥ 6 ↩ 4
不是,你这个召回测试一点意义都没有,像哈利波特这种模型本身就有训练,直接问其他大模型都能回答对,都不用提哈利波特。召回测试简单的方式是用最近一个月新上的网文进行测试,复杂的把哈利波特的原文一 一修改再提问,直接拿哈利原文我是没想到的
♥ 6
glm4.6 指令遵循非常一般,它很喜欢按自己的想法编程,也就是“预制菜”,拉都拉不回来,然后遇到不熟悉的,反复很多轮都无法解决问题。
♥ 5 ↩ 2
怎么感觉对你的测试项目做了优化?
♥ 5 ↩ 3
对比来看 好像 glm4.7 还是略强于 m2.1?
♥ 4
我试着用它做一个基于我上传文件,全选择题的HTML网页都做不成,啥情况?deepseek和gemini表现很好,甚至连网页的样式都极其相似。[笑哭]
♥ 3 ↩ 3