我让7个AI给我的猫建了个天堂 | 六大国产AI编程能力横评,春节AI横评第二弹

Description
Qwen3.5、GLM-5、Seed 2.0、MiniMax、Kimi、Step、Claude,统一提示词,全程录屏。有惊喜,有翻车,有后门账号,有代码彩蛋。这不是benchmark,是一次赛博斗蛐蛐。祝各大国内厂商早日干翻Claude。

Comments

瑾珩君 2026-02-19

我纯个人经验,当AI编程效果不好时: 国内模型:我认为是模型的问题; 国外模型:我认为是我自己的问题; 试卷简单大家都能考八九十分,但难的时候,就是可用和不可用的区别了

♥ 36 ↩ 4

zxyzxy123 2026-02-19

有一说一我还是更喜欢看up这种纯项目实测,哪怕有点不太客观,但实际项目就是实际项目,跑分现在真就图一乐[藏狐]

♥ 36

白口铁龙 2026-02-19

我的体验也很主观 vibe没少玩 体验下来除非价格相差300%+ 不然绝对不要去降低模型的梯队。 t0模型1mtok能实现的效果。 t1模型1mtok,那他就有可能不能一次成功,到时候再审计再改再迭代再测试,tok多花了不说😡我的时间是不是钱啊😡 t2以此类推。 看起来竞技场排名上面的可能就差几个点,实际使用天差地别。ps:之前glm4.7不是说对标Claude4.5son嘛[doge]我实际使用他对着gemini3p写的前端和Claude4.5ops的api文档修正接口连连看都连不明白[doge]那为什么我说这个呢?那肯定是因为Claude4.5son他还真能连明白。 然后glm5.0刚刚出来的时候窝借了个max有权限的账号测了,[doge]东西我给他发测试题目,他搁哪穷举数据找答案就和考试带手机我自己不写我网上搜索一样。 我找到答案了我直接填上去,你等着吼,正确这一块嗷。 这下感觉是看懂了,模型也搞应试训练是吧,真的是屋檐粒。

♥ 28 ↩ 10

梦过风 2026-02-19

说实话KIMI k2.5在官方哪里跑效果还是不错的,然后第三方提供的就非常烂,哪怕是官方提供的API也很难达到官网的效果,官网肯定是有特殊优化的。 其次关于Claude,我做过关于它的API适配,可能是协议的问题,一般情况下调用Claude就必须使用anthropic的协议不然会出现大问题。

♥ 15 ↩ 6

TzuchinB 2026-02-20

我用claude及codex,兩者都很不錯,後者尤其便宜。  但我最終花100usd訂閱claude而不是20usd的codex...

♥ 14 ↩ 9

始终_冷暖自知 2026-02-21

感觉现在国内模型,就是跑分强,跟我之前上学一样,为了考高分,刷题,但是实际上一到日常应用,就和你的分数比差了一,之前写了一个干细胞档案管理系统(包括血液回输功能),国内的GLM4.6我写了差不多一周,真就是新增一个功能,大概要花几个小时去修改BUG,就是感觉自己可能描述上面有问题,后来改了国外模型后,真就是新增功能和修改BUG,太丝滑了

♥ 13 ↩ 2

我问怎么知道新名字 2026-02-20

Claude 目前订阅了Pro,离职在家就不买100-200刀的Max,Claude就是断崖式的领先,写白话他是所有这一轮写代码模型中,最听得懂人意图的, 很多描述并不清楚的地方,做出来的plan plan就是我想要的。但是Pro用量实在是太少了,用Haiku做管理类的工作,1小时跑跑完用量。 其次是MiniMax,速度相当快同时,能力比较稳定和综合,是有犯傻的时候,工具调用一直没出过问题,反观k2.5 glm有出现过工具调用出现问题的。目前觉得对Tearm模式支持比较好的国产模型,就是MiniMax了。 opencode用了两轮就不用了,比cc直观上要差不少,目前用法挺老套的,大部分Claude写Plan,Request,Technical,然后切到MiniMax去执行。然后看情况去用反重力的Gemini

♥ 11

大贝尔熊 2026-02-21

也就是说,其他国产模型都是用OpenCode跑的不行就算了,ClaudeOpus4.6在OpenCode上跑不通工具调用出问题就可以上自己家的Claude-Code再跑一个高分出来。想起刚看的飞驰人生3的台词:我们愿意尊重规则,但它起码得公平啊! 既然想突出ClaudeOpus4.6,为什么不从一开始就用CCR来调用所有第三方模型,在Claude-Code环境下做测试呢?我记得GLM和Minimax的模型本来就是为Claude-Code环境高度优化的,在OpenCode环境就会有很多莫名其妙的工具调用BUG.

♥ 10 ↩ 1

暮雪劉年 2026-02-20

我只是想说一个就是,因为我用过各种各样的中转,就是如果说你要比他们的官方的利益的话,就是你要发挥一个模型最强的能力,那你一定是要去上他的官方的,不要上中专,很多中转是假模型,而且存在二次中转的情况。模型的能力是有损失的。所以说如果你真的要用最强的模型,那我恳请你一定要上官方。[笑哭]因为我自己用过非常多的中专。你不同的中转,它相同的模型名字。能力差距都有,而且很明显,而且有的中转它是没有thinking模型的。这种就是很经典的反代出来的某一个家国外的ide的模型。

♥ 9 ↩ 4

DDDDDDDDDDee 2026-02-21

省流:08:19 minimax参数少,世界知识、专业知识完全不够;kimi2.5会复读;glm很慢,也经常不作为;gemini上下文理解有点问题;目前看来主codex+副claude是性价比最高方案

♥ 7 ↩ 1

Si-C神经网络 2026-02-20

对我这样的穷人来说,根本不用考虑codex以外的模型,gpt team约等于免费白送,其他即使国产模型基本也要钱

♥ 5 ↩ 7

吉米_格棱言 2026-02-19

请把价格这个因素加在打分表上

♥ 5

AxolotlXM 2026-02-20

5.3codex用5天了 真的很强,opus4.6感觉复杂项目不太行了

♥ 4 ↩ 4

笑尽狂沙 2026-02-24

虽然我个人不喜欢 Claude,但编程工作现在看来还是 Claude Code 好用,下一次测评可以试试看用 CC 搭配 CC switch 来切换账号使用。我个人体感是国产模型到了 CC 里面,代码质量和效果都比在 opencode 里面写出来的要好,估计是 CC 有一些编程特化和工具特化(毕竟MCP,Tools, Skills 之类的都是 Claude 提出来的),而且国产模型对 CC 的支持也更好吧。 我也非常支持你的结论,真的是便宜模型不能做正事,浪费的时间和心情/信心比模型成本还贵。我现在就只能拿 GLM Pro 年包拿来做些很简单的Openclaw 的工作,稍微复杂的都不信任

♥ 4 ↩ 2

我就随便看看灬 2026-02-23

有没有可能是 claude code 的底层 agent prompts 写的好,而 open code 没有那么完善

♥ 4 ↩ 1

清咛lime 2026-02-20

国产模型和codex没啥太大差距,不理解为什么在对比的时候没有5.3codex的对比,openai体感上确实给国产追上了

♥ 3 ↩ 4

账号已注销 2026-02-24

第三方的claude工具使用错误可能是因为这些第三方api是从antigravity等其他平台带出来的,这些平台本身有自己的系统提示词和工具调用指令。再在opencode里用相当于镶嵌了两层不一样的提示词,所以才出现的错误。

♥ 2

interpretable 2026-02-20

没装oh my opencode的opencode还不如claude code.

♥ 2 ↩ 2

老许吗 2026-02-20

up能不能把第一轮的提示词放出来试试,也挺想试试的。

♥ 2 ↩ 2

bili_30799946012 2026-03-01

能不能测测deepseekv3.2special

♥ 2 ↩ 1