Gemini-3.1-pro 实测! 更新了个寂寞?
合集 · 大模型竞技场 (79)
-
全网首测!DeepSeek 4 小时之前又发布了一个多模态模型 Janus-pro
1:40
-
5分钟教你使用AI写一个风扇控制器
4:24
-
10小时前发布的大模型 Mistral-small-24B 马上开测!
2:46
-
NVIDIA又要跌?DeepSeek 刚用 FP8 没多久,这 FP4 训练要来了
0:51
-
一招解决DeepSeek-R1无法连接网络问题!还能白嫖DeepSeek-R1!
1:43
-
国产视频生成框架!能让老黄唱野狼 Disco!
1:17
-
大模型竞技场 - Gemini-2.0-Flash 全网首测!
4:03
-
微信刚上线 DeepSeek, 腾讯又把 AI 知识库也接入 DeepSeek 了?
2:10
-
来啦!Grok-3 全网首测!登陆火星 demo!
2:52
-
视觉大模型也能推理了?来看Ovis-2视觉模型的效果如何!
1:55
-
谁是最强写代码模型? 我使用了最好的21个模型, 花了50刀, 总计测试252次
7:32
-
全站最速!DeepSeek-V3-0324 写代码能力评测!不仅 OpenAI, Claude 也要颤抖了
2:06
-
我用AI做了个网页版我的世界,还能用砸瓦鲁多
4:18
-
全站最速!GPT-4.1 写代码能力评测!啊?又拉了?
2:25
-
极限测试!Qwen3 写代码+画画!究竟是不是开源最强模型?
5:53
-
我发现了AI最有用的用途——整理桌面!来看 Kimi-K2 Agent 能力实测!
12:42
-
使用 AI 做了个以《三体》中叶文洁为视角的小短片——三体·独白
2:02
-
nano-banana 幼儿园级教程① 如何将照片转换为城市天际线风格的建筑!
0:37
-
nano-banana 幼儿园教程第②弹! 教你如何做模特图!
1:06
-
nano-banana 幼儿园级教程第③弹! 如何实现贴纸自由!
0:55
-
nano-banana 幼儿园教程第四弹! 教你如何克隆喜欢的图标!
0:46
-
nano-banana 教程第五弹! 如何万物像素化!
0:41
-
nano-banana 生成 8K 分辨率图片教程!
1:10
-
Kimi-K2-0905 实测! 一口气输出1100行代码
3:06
-
Qwen3-Max-Preview 实测! 给大家放个鞭炮
1:41
-
Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗?
2:20
-
刚发布的 Qwen3-TTS-Flash 实测!
1:31
-
DeepSeek-V3.2 实测! 真就只提升了0.1?
2:54
-
Claude-Sonnet-4.5 实测! 口嫌体正直国庆献礼?
2:18
-
GLM-4.6 实测! 最近都很流行更新一大截然后版本就增加0.1嘛?
2:22
-
DeepSeek 竟然是 INTJ, 如果改成 INFP 会怎样?
2:22
-
claude-haiku-4.5 实测! 便宜大碗?
2:05
-
Vibe Coding 不流行了? Spec Coding 教程来啦
2:15
-
KAT-Coder-Pro-V1 实测! 早放3个月就好了?
2:36
-
Minimax M2 实测! 你也晚了3个月?
2:07
-
Cursor 推出炼蛊模式!一口气能开8个代理!
1:16
-
Cursor 终于有自己的大模型啦!来看实测!
2:32
-
Qwen3-Max-Thinking 实测! 呃......
2:28
-
Kimi-K2-Thinking 实测! 差距继续缩小!
2:17
-
Gemini 3.0 Pro 实测! SOTA! 不过发现两个重要问题!
3:17
-
nano banana pro 幼儿园教程! 如何合成橱窗图片!
0:52
-
Meta 的新模型 SAM 3 实测!
4:31
-
什么? 用 Claude Code 剪视频?
2:05
-
DeepSeek V3.2 正式版实测! 提升真的有限?
2:50
-
教程来啦! 如何使用AI打造自媒体博主军火库
2:57
-
GPT-5.2 实测! 美是真的美, 卡是真的卡
2:54
-
一秒生成高斯点云? Apple新模型SHARP实测!
1:25
-
AI送外卖到底有多强? 来看 Doubao-Seed-1.8 Agent 能力评测!
4:38
-
现在都流行大模型月更吗? MiniMax-M2.1 实测!
4:33
-
2025年全球大模型厂商下载量排行榜
3:42
-
500张图片测试! 一个视频告诉你GLM-Image怎么用!
3:27
-
不写 prompt 改看视频了! Kimi-K2.5 实测!
5:58
-
提升明显! Qwen3-Max 正式版 vs Preview版 实测!
4:55
-
不是说好了年前不发吗? DeepSeek 你个大猪蹄子
2:29
-
GLM-5发布啦! 给大家带来实测! 国产大模型正式进入月更节奏!
7:04
-
啊?一个月一个版本? MiniMax-M2.5 4000万 token 实测!
5:06
-
Qwen3.5实测! 来看贺岁档大模型的实力!
7:01
-
Gemini-3.1-pro 实测! 更新了个寂寞?
4:32
-
inclusionAI Ling&Ring 2.5-1T 大模型实测!
5:15
-
Agent 能力有多强? 来看豆包 Seed 2.0 实测!
6:07
-
龙虾专用大模型? GLM-5-Turbo 实测!
5:10
-
如何做一个生产级SKILL? 用MiniMax-M2.7给龙虾写SKILL的保姆教程
3:44
-
从国产SOTA走向世界SOTA? GLM-5.1 实测!
8:01
-
AI能帮我拍照了? Qwen3.5-Omni实测!
6:06
-
花费106刀测试! Claude-Opus-4.7 到底更新了啥?
8:51
-
Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏!
9:04
-
大模型写代码比说话还快是什么体验?
2:32
-
Agentic Coding 能力大幅提升! Qwen3.7-Max实测!
7:36
-
MiniMax-M3 最佳实践? 这个视频告诉你!
5:39
-
Fable 5 超越人类还为时尚早!
1:06
-
单卡 700TPS! Diffusion Gemma 来了!
0:44
-
GLM-5.2实测! 什么才是Agent能力的提升?
5:40
-
2分钟教你做一个可以自我迭代的 Agent
1:43
-
Flash模型横评! 性价比之选竟然是这个?
6:12
-
混元3实测! 300B参数竟然有这种Agent能力!
6:33
-
1B就能达到这种效果?LingBot-Vision实测!
1:13
-
Kimi-K3 全方位实测! 我竟然打游戏输给了她?!
14:05
-
我用 LongCat-2.0 省了 88% 的 Agent 输入成本!
4:57
-
我让 Qwen3.8-Max 玩游戏, 结果发现了善良的数学意义!
9:46
Description
光速给大家带来 Gemini-3.1-pro 实测! 指令遵循: 洛希极限测试中部分指令遵循率 93.5% (3.0-pro 为 90.6%), 加权总分从 6.8 提升到 8.6, 数据上确实有进步. 但实测中 6 次测试有 4 次输出的 JS 代码直接报错无法运行, 2/3 的失败率属实离谱. 后端编程: vector DB Bench 向量数据库测试中, 3.1-pro QPS 成绩 658, 而 3.0-pro 刷到了 1970, 是 3.1 的整整 3 倍! 两者都用了 IVF 倒排索引, 但 3.0-pro 聚类参数更优 (K=2048 vs 1000), 并且用最大堆替代 Vec 排序, 内存开销仅为后者的 0.7%, 新版反而被老版碾压. 前端编程: 表现极不稳定. 大象牙膏喷发效果提升但碰撞效果有些诡异, 鞭炮连锁爆炸光影效果消失了, 鞭炮炸鱼缸水面波纹不错但丢掉了粒子和烟雾. 唯一亮眼的是陀飞轮机芯测试, 空间理解明显增强, 这也解释了为什么最近 X 上各种 SVG 测试都是 SOTA. 总结: Gemini-3.1-pro 给我最大的感受就是——不稳定. 前端有进有退, 后端没打过 3.0-pro, 性能优化过程中甚至出现越优化越差的情况. 更像是一个没训练稳定就仓促发布的技术预览版. 如果你用着感觉不对劲, 不妨先换回 3.0-pro. 让我们等一波正式版到时候再给大家测一下看看.
Comments
gemini产品力不行,,不是说模型开发的不好,而是模型产品的调教真的很有问题,,比如企业市场第一名Claude,赢就赢在稳定,Claude的性能跑分一直不是王者,但实际使用王者,所以价格那么贵用户还最多。
♥ 174 ↩ 25
3.1拉了一坨大的...少見google會放出這麼拉的模型 Ai atudio介面變得好難用...等等5月大更新
♥ 63 ↩ 15
最好的就是2.5,难绷越更新越拉
♥ 39 ↩ 16
这是为啥呢?3.1在AA上提升幅度巨大,在nao佬这些民间实测榜单提升也很大,重回SOTA,为啥表现差别这么大?
♥ 29 ↩ 28
gemini 3.1 pro 长文本还是烂,不如deepseek目前
♥ 26 ↩ 15
估计是提升了,但是提升不大所以叫3.1 小小期待一下3.5,不指望能在Coding上打过a÷和OAI但是Chat不落下就好了[五月织姬ctsu_思考中]
♥ 26 ↩ 4
不用问肯定是稀疏注意力那些神人玩意儿
♥ 20
刚试了下grmini3.1在线打一个ctf比赛,一道密码学题目,doubao2.0 pro搞了一个小时还在暴力破解了,3.1两分钟找出可以利用的密码学攻击方法解对了,但额度太少了,编码感觉也就那样,但聪明确实聪明
♥ 19 ↩ 11
3.0就是超级跑分王,有效上下文拉裤裆里去了,3.1看官方文章就搁那贴跑分然后讲svg,就没了,合着练怎么跑更高分去了说是
♥ 15 ↩ 4
刚出两天就开始偷换模型了,谷歌太恶心了🤢🤢我今天用3.1思维链长度只有一两行,问他antigravity是啥都不知道,我使劲追问半天才承认自己是2.5 flash[笑哭]
♥ 14 ↩ 3
✨ AI课代表总结: Gemini-3.1-pro实测显示指令遵循率微增至93.5%,但代码生成错误率达66.7%(6次测试4次失效),严重影响实用性。后端向量数据库测试QPS仅658,远低于3.0-pro的1970,主因索引参数配置不合理(1024 vs 2048),致查询效率低下。前端特效表现两极:空间理解增强(如土飞轮动态细节优化),但粒子物理逻辑频繁故障(如碰撞异常、效果缺失)。综合判定该版本属仓促推出的技术预览版,稳定性与性能均未达预期,强烈建议用户暂时退回3.0-pro以获取稳定服务。 本喵反复验证后确认,Gemini 3.1-pro仍需深度优化方能投入实用,开发者宜持审慎态度推进迭代。
♥ 13 ↩ 1
感觉3.1 pro聪明不少,尤其是处理那些接轨现实世界的问题。3.1 pro其实就是前几天新版deep think的基底模型,其实还是能看出来和3 pro的差别的。代码水平不好归代码水平不好,但在总体智能程度层面,或者说洞察力,我感觉比opus4.6更强
♥ 12 ↩ 4
nanobanana跟gemini的版本有关系吗,感觉生图效果没怎么变啊,我一般拿来修照片,其他功能倒是不怎么接触。
♥ 9 ↩ 5
我发现一个问题啊就是模型能力好像确实变强,但是编程能力不行啊,让他写一个简单的网页游戏,然后他不是那里出错,就是语法没写对,要么就是少了括号,我没想到这种基础错误也能犯
♥ 8 ↩ 4
不知道为什么都喜欢测前端之类的代码,之前的glm,qwen也是,好多up主都喜欢通过前端界面或者写小说什么的来判断大模型的能力,感觉大模型的核心能力还是推理能力和数学能力,应该找几个算法竞赛codeforces/洛谷/xcpc/cmo之类的题测一下才好吧
♥ 7 ↩ 5
会不会是因为刚上线,还不太稳定,glm5刚上线的时候我试的感觉特别拉,但后来过几天稳定后再测感觉还可以
♥ 7 ↩ 1
尽量聚焦到自己的领域去自己对比一下。就知道对你来说是升级还是如何了。这些测评视频的价值就是让你心里有个标准,至于如何,是提升还是变弱,这取决于你的独立思考。
♥ 6
Gemini智力水平实在是太高了,知识储备丰富,理解能力强,其他模型压根比不了,尤其是gpt,智力一代不如一代,注意力再强有什么用呢?现在Gemini的智商就是无法取代的
♥ 5 ↩ 3
觉得gemini3越来越差,注意力会丢失,明明提示词里有的内容都看不到
♥ 5