谁是最强写代码模型? 我使用了最好的21个模型, 花了50刀, 总计测试252次
合集 · 大模型竞技场 (78)
-
全网首测!DeepSeek 4 小时之前又发布了一个多模态模型 Janus-pro
1:40
-
5分钟教你使用AI写一个风扇控制器
4:24
-
10小时前发布的大模型 Mistral-small-24B 马上开测!
2:46
-
NVIDIA又要跌?DeepSeek 刚用 FP8 没多久,这 FP4 训练要来了
0:51
-
一招解决DeepSeek-R1无法连接网络问题!还能白嫖DeepSeek-R1!
1:43
-
国产视频生成框架!能让老黄唱野狼 Disco!
1:17
-
大模型竞技场 - Gemini-2.0-Flash 全网首测!
4:03
-
微信刚上线 DeepSeek, 腾讯又把 AI 知识库也接入 DeepSeek 了?
2:10
-
来啦!Grok-3 全网首测!登陆火星 demo!
2:52
-
视觉大模型也能推理了?来看Ovis-2视觉模型的效果如何!
1:55
-
谁是最强写代码模型? 我使用了最好的21个模型, 花了50刀, 总计测试252次
7:32
-
全站最速!DeepSeek-V3-0324 写代码能力评测!不仅 OpenAI, Claude 也要颤抖了
2:06
-
我用AI做了个网页版我的世界,还能用砸瓦鲁多
4:18
-
全站最速!GPT-4.1 写代码能力评测!啊?又拉了?
2:25
-
极限测试!Qwen3 写代码+画画!究竟是不是开源最强模型?
5:53
-
我发现了AI最有用的用途——整理桌面!来看 Kimi-K2 Agent 能力实测!
12:42
-
使用 AI 做了个以《三体》中叶文洁为视角的小短片——三体·独白
2:02
-
nano-banana 幼儿园级教程① 如何将照片转换为城市天际线风格的建筑!
0:37
-
nano-banana 幼儿园教程第②弹! 教你如何做模特图!
1:06
-
nano-banana 幼儿园级教程第③弹! 如何实现贴纸自由!
0:55
-
nano-banana 幼儿园教程第四弹! 教你如何克隆喜欢的图标!
0:46
-
nano-banana 教程第五弹! 如何万物像素化!
0:41
-
nano-banana 生成 8K 分辨率图片教程!
1:10
-
Kimi-K2-0905 实测! 一口气输出1100行代码
3:06
-
Qwen3-Max-Preview 实测! 给大家放个鞭炮
1:41
-
Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗?
2:20
-
刚发布的 Qwen3-TTS-Flash 实测!
1:31
-
DeepSeek-V3.2 实测! 真就只提升了0.1?
2:54
-
Claude-Sonnet-4.5 实测! 口嫌体正直国庆献礼?
2:18
-
GLM-4.6 实测! 最近都很流行更新一大截然后版本就增加0.1嘛?
2:22
-
DeepSeek 竟然是 INTJ, 如果改成 INFP 会怎样?
2:22
-
claude-haiku-4.5 实测! 便宜大碗?
2:05
-
Vibe Coding 不流行了? Spec Coding 教程来啦
2:15
-
KAT-Coder-Pro-V1 实测! 早放3个月就好了?
2:36
-
Minimax M2 实测! 你也晚了3个月?
2:07
-
Cursor 推出炼蛊模式!一口气能开8个代理!
1:16
-
Cursor 终于有自己的大模型啦!来看实测!
2:32
-
Qwen3-Max-Thinking 实测! 呃......
2:28
-
Kimi-K2-Thinking 实测! 差距继续缩小!
2:17
-
Gemini 3.0 Pro 实测! SOTA! 不过发现两个重要问题!
3:17
-
nano banana pro 幼儿园教程! 如何合成橱窗图片!
0:52
-
Meta 的新模型 SAM 3 实测!
4:31
-
什么? 用 Claude Code 剪视频?
2:05
-
DeepSeek V3.2 正式版实测! 提升真的有限?
2:50
-
教程来啦! 如何使用AI打造自媒体博主军火库
2:57
-
GPT-5.2 实测! 美是真的美, 卡是真的卡
2:54
-
一秒生成高斯点云? Apple新模型SHARP实测!
1:25
-
AI送外卖到底有多强? 来看 Doubao-Seed-1.8 Agent 能力评测!
4:38
-
现在都流行大模型月更吗? MiniMax-M2.1 实测!
4:33
-
2025年全球大模型厂商下载量排行榜
3:42
-
500张图片测试! 一个视频告诉你GLM-Image怎么用!
3:27
-
不写 prompt 改看视频了! Kimi-K2.5 实测!
5:58
-
提升明显! Qwen3-Max 正式版 vs Preview版 实测!
4:55
-
不是说好了年前不发吗? DeepSeek 你个大猪蹄子
2:29
-
GLM-5发布啦! 给大家带来实测! 国产大模型正式进入月更节奏!
7:04
-
啊?一个月一个版本? MiniMax-M2.5 4000万 token 实测!
5:06
-
Qwen3.5实测! 来看贺岁档大模型的实力!
7:01
-
Gemini-3.1-pro 实测! 更新了个寂寞?
4:32
-
inclusionAI Ling&Ring 2.5-1T 大模型实测!
5:15
-
Agent 能力有多强? 来看豆包 Seed 2.0 实测!
6:07
-
龙虾专用大模型? GLM-5-Turbo 实测!
5:10
-
如何做一个生产级SKILL? 用MiniMax-M2.7给龙虾写SKILL的保姆教程
3:44
-
从国产SOTA走向世界SOTA? GLM-5.1 实测!
8:01
-
AI能帮我拍照了? Qwen3.5-Omni实测!
6:06
-
花费106刀测试! Claude-Opus-4.7 到底更新了啥?
8:51
-
Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏!
9:04
-
大模型写代码比说话还快是什么体验?
2:32
-
Agentic Coding 能力大幅提升! Qwen3.7-Max实测!
7:36
-
MiniMax-M3 最佳实践? 这个视频告诉你!
5:39
-
Fable 5 超越人类还为时尚早!
1:06
-
单卡 700TPS! Diffusion Gemma 来了!
0:44
-
GLM-5.2实测! 什么才是Agent能力的提升?
5:40
-
2分钟教你做一个可以自我迭代的 Agent
1:43
-
Flash模型横评! 性价比之选竟然是这个?
6:12
-
混元3实测! 300B参数竟然有这种Agent能力!
6:33
-
1B就能达到这种效果?LingBot-Vision实测!
1:13
-
Kimi-K3 全方位实测! 我竟然打游戏输给了她?!
14:05
-
我用 LongCat-2.0 省了 88% 的 Agent 输入成本!
4:57
Description
LMArena榜单现在如同红点设计奖, 只要新模型发布就能霸榜. 甚至GPT-4.5没有可圈可点的地方最后在大模型EQ(你没看错就是情商测试)榜单获得了第一. 让我们来点现实世界命题, 确保项目足够复杂, 无法针对性训练, 达到大模型一次生成的天花板. 敬请看——本期大模型竞技场——谁是最强写代码模型? 另外由于 GPT-4.5 齁贵 (每百万token 150刀, DeepSeek-R1 只要2.19刀), 所以我就帮大家测了, 顺便能让大家省下24刀调用API的钱😭 另外的另外, 在制作视频过程中, QwQ-32B 发了, 所以这次测试结果甚至包含了 Qwen-QwQ-32B-BF16 另外的另外的另外, 测试集和测试结果开源, 地址: github.com/KCORES/kcores-llm-arena
Comments
对我这种非计算机科班出身,但是工程和计算机的交叉领域研发人员,我个人在用户端的感觉是claude3.7和grok3能解决我大部分的编码需求。deepseek也很强,但是现在也许是算力原因响应太慢了,所以用的很少。GPT(主要用4o,o3)相对差一些,已经停止订阅了。不得不说,从我个人的体验来说,GPT确实不再领先了,不知道它能不能在Agent上再划一次历史。
♥ 159 ↩ 9
你出题注意下次别用python , 让用cpp或者rust然后才能体会到啥叫做都是幻觉
♥ 146 ↩ 11
我想都没想肯定是cursor+claude3.7[笑哭]这两天那我给整舒服了[吃瓜]没有一组生成的量化代码让我失望的[呲牙]而且还学习了更多的书写方法和技巧[打call]太强太能打了[doge]
♥ 102 ↩ 25
看完了,up太肝了,牛逼[支持] 话说现在有啥性价比的日常使用最优解么,用cursor开会员? 我本来挺抗拒百度的,但是使用中发现 百度的dsR1联网搜索的网页数量会多很多,腾子元宝的dsR1联网搜索只搜五六个网页,会造成同一个问题出的结果也不一样。 (另外...百度一直没出mac端应用,网页来回切的挺烦)
♥ 99 ↩ 21
claude 得了 MVP![doge]
♥ 98 ↩ 4
[笑哭]确实蛮符合我随机优化的结果,文字用deepseek,代码用claude。deepseek文字功底非常棒,就是爱编数据,编参考文献。
♥ 84 ↩ 11
直接、效率、完整、内容严谨、有依据、一点废话都没有,业界标杆。[doge][支持]
♥ 55
我自己平常工作也用来写写代码,只能说,现实环境下,描述这个过程才是最难的,描述和让ai修bug的时间可能自己都写完了,而且偶尔ai还会犯错,把报错提醒给它看分析不出来原因,主要有些问题太抽象了,数组超出长度的这种问题都算好修的了
♥ 48 ↩ 5
正好GitHub copilot可以使用Claude的3个模型[给心心]
♥ 23 ↩ 6
我寻思测试代码功能难道不应该是丢一个任意非python语言的十万行代码项目让它们解决其中的某个bug吗?[doge]
♥ 22 ↩ 6
UP有没有考虑加入openai-o3-high模型呢?这暂时是openai写码最强模型了,不然拿o3-mini和Claude3.7对比不太够格
♥ 22 ↩ 6
claude好用,deepseek太犟了,幻觉很严重,不仅给你编代码,还给你编运行结果
♥ 20
写c++就老实了,没一个能用的
♥ 15
我突然产生了一个小小的疑问,现在的ai写不了长篇小说,那是否存在让AI写一个可以写长篇小说的模型的可能呢?
♥ 15 ↩ 12
看完感觉我的openai的20刀没必要续了,有点特色的deepresearch也不让多用几次[笑哭]最近qwenmax效果起来了,dpsk也变得流畅了,gpt有点浪费钱了hh
♥ 15 ↩ 2
和我的直觉很符合,用下来确实claude牛逼,然后就是国产之光,随后gpt有些场景也不差,谷歌也有说法。最让我惊喜的是本都版本的千问,阿里比百度多了不知道个数量级,感觉百度钱也花了,产品也没多牛,坐拥中文互联网曾经最丰富的数据库真白瞎了。
♥ 13 ↩ 2
已关注,有依据,直接给结论,标杆视频
♥ 12 ↩ 1
我在实际工作中写代码包括了加新的feature,debug, 写单元测试和集成测试,以及部署到各种环境。按照实际工作的内容作为brenchmark, 现在的AI暂时还是只能堪堪解决部署那个部分,其他的几个部分囿于上下文的限制仍然做的不是很好。不过写几个脚本快速调用不熟悉的python库是完全没问题的,虽然需要部分调整,但是比我自己写起来块多了。总的来说,AI目前为止还是比较适合当一个编程老师并不能完全取代初级程序员的工作
♥ 12 ↩ 1
有没有考虑同一大模型同一个prompt多次测试的结果也会有差别
♥ 10 ↩ 6
听见prompt读作pron-pot我退出了视频
♥ 9 ↩ 14