发布即开源!多模态大模型正在从“看得见”走向“看得懂、想得通”。

合集 · 多模态模型 (7)

  1. 46:40
    CogVLM2:第二代视觉大模型,19B即可比肩 GPT-4V
  2. 1:31
    全新GLM-4v-plus,更强的视频理解能力
  3. 3:24
    AI 的「phone use」时刻也来了
  4. 2:33
    GLM-4-Voice:国内首个端到端语音模型
  5. 2:04:49
    从 Sora 看多模态大模型的未来
  6. 1:35
    发布即开源!多模态大模型正在从“看得见”走向“看得懂、想得通”。
  7. 1:25:15
    开源通用视觉语言模型GLM-4.1V-Thinking技术分享
Description
GLM-4.1V-9B-Thinking引入 课程采样强化学习策略,在多个复杂推理任务中实现能力突破,整体性能达到 10B 级别视觉语言模型的领先水平。在 18 项权威评测中,GLM-4.1V-9B-Thinking 的表现已可比肩甚至超越参数量高达 72B的 Qwen2.5-VL-72B,充分展示出结构设计与训练策略的先进性与效率。
论文链接:https://arxiv.org/abs/2507.01006
Github:https://github.com/THUDM/GLM-4.1V-Thinking

Comments

速度低 2025-07-04

希望能gguf,个人电脑还是gguf比较简单

♥ 52 ↩ 11

十字鱼 2025-07-04

欢迎体验 BV12q34zwEZS

♥ 31 ↩ 6

momo-----------_ 2025-07-04

上ollama吗?

♥ 18 ↩ 6

insonn 2025-07-05

之前GLM效果挺一般的,我用来识别文旅短片,一直循环语句,效果不如那会的qwen2.5vl,更不如gemini2 flash

♥ 16 ↩ 3

杰士尼de少年Pie 2025-07-04

那么你ChatGLM能不能添加更多能力:理解音乐,分析音乐的谱子,解析音乐,解析视频里的音乐,生成音乐呢?[吃瓜]AI音乐理解可是国产AI的短板,CHATGLM可要做起来呀!

♥ 10 ↩ 1

GYlove1994 2025-07-05

这个视频的bgm是不是有点怪[doge]

♥ 7

悠船 2025-07-04

网页版试了一下感觉。。emm

♥ 6 ↩ 5

AI全文总结 2025-07-04

AI课代表总结:视频通过四个场景验证BigModel的多模态能力——1) 分析足球赛事技术细节与战术配合;2) 解读科幻电影情节并预判剧情走向;3) 根据商品标价自动计算购物总费用;4) 依据界面截图生成对应React代码框架。全程展现模型对图文视频信息的理解、推理与跨模态生成能力。 ✨ 本喵都要惊掉下巴啦!这模型简直是全能型选手,从绿茵场到编程界统统拿捏得死死的~ --内容由@AI视频总结 生成,仅供参考【很棒的视频,快给up主点赞】

♥ 2 ↩ 3

魔法x数字 2025-07-10

军用是不是无人机可以推测敌人动向指挥地面作战了。

♥ 1

可爱的男玩家 2025-07-04

视频的类GRPO训练,好东西

♥ 1

天之子12345 2025-07-05

你们的混合推理模型还没有出来吗

♥ 1

老宅0451经费战士418 2025-09-29

挣钱吗

本人是17岁 2025-09-09

模型知不知道动物是怎么知道哪个是食物的如何辨认

盐水洗海带 2025-07-13

看得懂什么,又不是讲开发的

秧苗G 2025-07-12

我当学生的时候要是做数学题有这些就好了,要么没答案要么只有答案。[笑哭]

传承双龙 2025-07-19

网页版性能跟千问和gemini比落后太多了,连网页版都做不好,谁又兴趣关心你的新模型的指标,很影响印象

水部员外郎 2025-07-08

闷声发大财,看好

Mdy_小鹏 2025-07-07

最长可以总结多长的视频,可以给视频放针找出来吗

GarfieldZzz0702 2025-07-06

牛逼牛逼

Booter 2025-07-06

哇哦,这么厉害👍🏻