6大AI模型暴力测评!2026到底谁才是真好用?

Description
最近一个月,ai模型发货的速度也太快了
Claude Opus4.8、Qwen3.7Max、DeepseekV4Pro、Kimi k2.6、小米mimo等等
今天给大家做一个测评,看看市面上这么多模型,我们普通用户面对不同的任务,到底怎么选

Comments

雾离R 2026-06-05

拿网页版deepseek来测是何意味

♥ 195 ↩ 26

烨言君 2026-06-07

海外选手,调研过一下身边的同学,分享一下身边的情况,其中中国人几乎清一色gpt,Claude用户基本是gpt的三分之一左右,而且多为工科或者计算机学生,印度/孟加拉/巴基斯坦南亚三国的人各有千秋,基本稍微懂点ai的都用Claude,东南亚人可就太多了,可能是因为出身普遍不好他们中间有好些用中国模型,我身边好几个泰国越南的cs大佬反而常用DeepSeek,白人不好统计,但基本是Gemini,Claude,GPT御三家,到没有感觉哪个更多一些,日本人韩国人用GPT更多一些

♥ 135 ↩ 31

想好好工作的小熊猫 2026-06-05

我之前用DS和Mimo去操作一个上百个文件下载的重复任务,Ds经常做一半,有突发奇想,然后就不知道怎么做了,但是Mimo 突发奇想的一次被我拒绝了 剩下完成的就很完美

♥ 84 ↩ 13

寒山如梭 2026-06-05

gpt[doge]还不是最新的

♥ 62 ↩ 11

Kwant0_Official 2026-06-06

何意味,测试上下文,不用API,测试代码能力全都用claudecode,那肯定就是claude适配好啊,虽然claude本身就强,但你好歹换个容器,改下变量吧

♥ 36

雪舞蝶月 2026-06-13

求大佬指点——我用deepseek感觉甚至不如豆包,是使用方法不对么? 比如在查询某些细节问题时(比如我问常见NAS系统,对docker的权限、结合外网访问的端口映射,策略各是什么),deepseek不论是否要求在网上搜索得到具体消息,回答的准确率都远低于豆包。而且要求deepseek网上搜索,经常也会反馈个“xx网页打不开、有验证码”之类的。

♥ 31 ↩ 24

夜良辰xkx 2026-06-06

网页版测模型能力来了,还暴力测试呢

♥ 29

3e空白本白 2026-06-20

个人使用下来,千万不要用DeepSeek编程,特别是PRO模式,甚至不如flash,缺钱用千问,有钱就用Kimi或glm,minimax一般般勉强能用

♥ 28 ↩ 6

小鸣07 2026-06-05

个人感觉,GPT和它的生态的使用体验和所有其它AI都拉出断档了

♥ 34 ↩ 2

雨人Raymond 2026-06-18

豆包用过一两个月,问些计算题他能给你答案。 但在查阅资料这一块喜欢给你瞎整瞎搜集。 初使用你告诉他给错答案,哎!他还会道歉挺有意思… 但用久了会觉得有点反感,最后卸载了。

♥ 26 ↩ 1

Clozole 2026-06-06

要我说评价模型的智商还得看幻觉率。扣问号左右脑互搏亲测大部分ai中招。个人亲测所有主流模型只有GPT和Claude没中招,豆包的话专家模式没互搏,快速模式互搏了(公平起见所有模型都用的有联网功能的免费额度内的模型)[吃瓜]

♥ 20 ↩ 5

买菜i855 2026-06-15

小孩才做选择[doge_金箍]全部ai集成起来不香么[吃瓜]随时换着来用[打call]

♥ 29 ↩ 9

仍有呼吸 2026-06-06

ds现在我用下来最大的问题是喜欢自己加私货。已经明确说了要按照规范,禁止乱加,还是给我一通乱加。mimo的结果很多时候确实缺少一些灵性,但是总体上总是能符合我所想要的那种感觉,但是mimo配合cc的workflow很一般,不懂得并行设计,经常await,要你明确说要并行设计才会好点,然后workflow写入结果的时候,文本一长经常卡住,直接卡死,希望小米能尽快优化一下他们的算力吧。 然后opus4.8非常稳定,基本你告诉它要遵守规定,它就是按照规定来,但是太贵了,而且最终的结果也不是说就非常完美,很多时候花了ds和mimo十几倍的token,结果反而没有mimo给我的那种“我就是要你写成这样”的感觉,尤其是配合workflow的时候,一堆对抗审查的批注会留在里面。

♥ 17

轻舟入水 2026-06-05

ds 还算聪明但写代码有点粗糙,比如让他把另一个项目的某个功能模块抄过来,总是功能有异常,这块 glm 就比较老练。还有小米模型居然挺能打也是让我另眼相待,以前以为上不了桌面的

♥ 16

五行缺_肉 2026-06-06

上个月我开了一个月的chatgpt pro和一个月的Claude Max都是我自己的号,问同一个问题,chatgpt刚开始还会研究思考,一个问题差不多思考十几分钟,用了几次之后回答的越来越快了,而且回答也是很潦草,感觉是降智了…… Claude的回答对我来说确实很专业,好几轮之后的回答都比gpt要好的多,感觉也没怎么降智,只过不 每当下午用Claude时候,老是给我宕机,深度思考还没10分钟直接卡住不动了,要不就是聊天额度用了,就一直不动像是卡死了一样……

♥ 15 ↩ 1

朝花夕拾枯萎 2026-06-06

为啥没盘古大模型?自研模型配自研升腾卡,乱杀[嗑瓜子]

♥ 18 ↩ 18

桜井川奈屿 2026-06-06

我感觉测模型就得用 api,然后接入 pi 之类的简单 harenss 下来评测,有些模型在网页版就是阉割过的,而且平时真写代码不可能用网页的

♥ 14

99位大人 2026-06-08

免费豆包,我的反问质问吗?,触发了搜索工具(没问题), 但我输入的内容:“固定资产盘亏不是统一为营业外支出吗?”, 豆包大模型匹配的好像是“固定资产盘亏不是统一为营业外支出”,陈述句, 输出内容是反过来反驳我的[笑哭]整笑了

♥ 13 ↩ 2

不问出路不看岁数 2026-06-06

不用 API 测的吗,用网页的不行啊。不一样的(。-_-。)

♥ 13

青墨朱白 2026-06-05

我都是多个模型一块用,不让一个模型干活,那样出错了都不清楚,我习惯用GPT做架构,以及编程,kimi上下文长,就用Kimi把控整体方向,cluade用来做超出的严谨性审查。

♥ 13 ↩ 2