19.8亿次if循环的屎山代码,AI修的好吗?

Description
一个if循环19.8亿次,无数玩家被迫看云几分钟,这串代码出自于大名鼎鼎的R星。今天我拉来了17名AI模型,模拟人类黑客的黑箱环境,仅根据程序特征去制作补丁,能比得过黑客吗?欢迎来到大黑的AI整活横评,我们又来赛博斗蛐蛐啦!

Comments

吾王之saber 2026-05-21

一直在公司高强度用claude opus,说实话没有能一次就正确跑完任务的,我们是偏嵌入式的开发,我让它开发一个上位机来实时接收数据并解析、显示和存储,光这个就反复修改迭代了两天多,还是在我提供了完整的下位机代码、通信设计文档、上位机框架设计文档、GUI布局设计等东西,感觉AI经常忘东西,要不停地要求它自己阶段性地写总结文档,才能一步步走下去

♥ 332 ↩ 45

bobcy2012 2026-05-20

在我自己的真实项目开发中用过qwen3.6-plus,Mimo v2.5 pro,kimi K2.6,deepseek v4 pro/flash,用一个自我迭代改进AI算法的场景进行过一个不太严谨的测试。我个人的体验是deepseek v4 pro > kimi K2.6 > Mimo v2.5 pro > qwen3.6-plus > deepseek v4 flash。但有时候在一些很简单,就是上下文略长的时候,让大模型改一个php页面的500错误,结果kimi k2.6/qwen3.6-plus会翻车,而deepseek v4 flash却可以正常搞定。我个人猜测是上下文腐烂导致的,qwen3.6-plus虽然号称支持1M上下文,但实际上会话长度超过180KB后就容易出问题,kimi k2.6也是如此。GLM5.1的上下文最短只有200KB且不支持多模态,而且价格太贵,就没有使用过了。

♥ 331 ↩ 37

学习耽误玩 2026-05-22

豆包就是来负责搞笑的[doge]

♥ 240 ↩ 12

Sakura-Forgot-Me 2026-05-22

Gemini3.1pro从来都不是能力不行,是tm它就是懒啊,它tm每次修bug都能找到最短路径最简单的方法给你搞好敷衍过去,平时用来修bug就是疯狂给自己埋炸弹然后booooooooooooooom美丽[tv_斜眼笑]

♥ 75 ↩ 10

CYCLE_6 2026-05-21

我™绞尽脑汁也没想明白为什么R*要重新检查加载物品的hash是否有重复。 我们先姑且不论,既然已经有了hash值,为什么不直接存到一个hashmap里,可以随时快速查询key是否重复的问题。 问题的关键是,为什么要在客户端加载json数据时候做这种奇怪的校验?既然是线上游戏,你的物品清单必然应该是从线上下载的啊。那么玩家每次打开游戏时候,加载的Json文件就应该是一个干净的数据啊?里面的数据为什么会有重复和顺序错位呢?[笑哭][笑哭] 难道R星的商城数据不是从服务端动态下载的嘛?那他们有新活动或者有新DLC,都是玩家自己本地安装的DLC里有多个Json文件,所以里面的物品会冲突?那如果是这样,不怕玩家直接篡改Json文件作弊嘛?[喜极而泣][喜极而泣]

♥ 76 ↩ 6

稽术宅 2026-05-20

qwen3.6 35ba3b 4bit以下(如2bit, oQ2, 3bit, oQ3, oQ3.5)的量化经测试agent类功能几乎是不可用的,或者严重不稳定,但是问答仍能保持一定效果。27b估计也差不多。4bit以上效果会明显改善。因此最好不要拿4bit以下做测试[吃瓜]本地主流真正拿来干活的还是4bit以上,我测试过2-4bit这个分水岭很明显的。这样子测的数据会导致结果有差异。

♥ 51 ↩ 7

电波奥特曼 2026-05-21

我一直不相信qwen3.6:27b的表现这么差,直到我看到q3[doge]

♥ 41 ↩ 5

-那回忆抹掉的伤- 2026-05-22

一直支持国产,直到项目组为了方便给所有人开了codex工作组... 任重道远。

♥ 52 ↩ 8

伪枪神 2026-05-21

R星程序员:相信后人的智慧[doge]

♥ 37

青柠炒蛋 2026-05-23

这个结果挺符合日常使用体验,不像某些UP搞一些完全没意义的测试,测出来结果更像是商单

♥ 31 ↩ 2

四界六行 2026-06-05

我觉得最近几个月, AI变化真的特别大,特别是配合上Harness之后。 GPT、Claude、Gemini、Groq我都有订阅。我是GPT三年多的老用户了。但是年初的时候, GPT变得很笨,根本没法用。我就换了刚上市的Gemini。那个时候可能Gemini算力比较充足,所以性能很强,速度也很快。但越用越笨,3个月之后没法用了,我就换了Claude,同样的也是一开始很强,用了两个月也没法用。后来我对比了一下GPT5.5. 同样的,我用2000多行我unity 3d游戏里面的代码bug,让GPT 5.5和Claude 4.7别修复. GPT 5.5一次性就修复成功了,但是Claude 4.7连编译都没通过。 现在我就用Codex加GPT 5.5真的是越用越顺。然后花了两个月时间完善了Codex的安全系统以及Harness能力。现在我发现,直接让它帮我修改Unity的代码,都不会出错了。真的很神奇。就是当你的Agent系统完善到一定程度,它就基本上不太会出错了,只是有的时候用户在阐述规则和边界的时候不充分,导致一些功能实现有偏差。

♥ 26 ↩ 4

光头白先生 2026-05-21

唉,这到是个好方法啊,找一些知名的屎山代码去测试,不管你是否知道,总归是没有背景文件的,他也得重新写一遍

♥ 25

SoRaOtO@SYD 2026-05-20

跟我的感觉差不多,用同事的claude max跟我自己订阅的chatgpt pro,最近优化了一大堆程序,同时改写了几个工程量很大的c++程序到python。chatgpt稍微好一点点,不过差距不明显。但是改的结果几乎都不用修bug。真是太好用了

♥ 22 ↩ 6

一般记者约翰里德 2026-05-21

为啥GLM编程能力这么强官网聊天这么蠢?

♥ 17 ↩ 6

Granties 2026-05-21

这个排名完全符合我的使用体验,御三家太贵没用过,国内模型里我用的最多的就是deepseek v4 pro,kimi k2.6,还有GLM5.1,对比来说kimi k2.6解决不了的问题dsv4p能解决,dsv4p解决不了的问题GLM5.1能解决。Qwen3.6 plus,现在opencode里免费用,用了几次发现效果还不如deepseek v4 flash就没用了

♥ 16

电子生命-YY 2026-05-21

R星的程序员一看就没刷过力扣[笑哭]

♥ 19

有心即是有缘 2026-05-20

问题在于,黑客也是一次性解决吗?就是代码一次过。 ai忽略的地方,你作为验收员,不是可以要求吗?

♥ 30 ↩ 6

文剑丶水又二一 2026-05-22

我实在是很好奇Claude究竟是靠什么获得了这么强的能力。 我怀疑它们手里有着超大量高质量代码数据。

♥ 14 ↩ 7

小小鸽子 2026-05-20

这种横评有意思!让ai修复旧版本,人类可以看着更新日志做评分。Up再整这个活的话,可以试试steam最新热门单机游戏,这样可以避免ai世界知识的差异(而且还能蹭一下热游的流量)[打call]

♥ 14