开源通用视觉语言模型GLM-4.1V-Thinking技术分享

合集 · 多模态模型 (7)

  1. 46:40
    CogVLM2:第二代视觉大模型,19B即可比肩 GPT-4V
  2. 1:31
    全新GLM-4v-plus,更强的视频理解能力
  3. 3:24
    AI 的「phone use」时刻也来了
  4. 2:33
    GLM-4-Voice:国内首个端到端语音模型
  5. 2:04:49
    从 Sora 看多模态大模型的未来
  6. 1:35
    发布即开源!多模态大模型正在从“看得见”走向“看得懂、想得通”。
  7. 1:25:15
    开源通用视觉语言模型GLM-4.1V-Thinking技术分享
Description
以小博大,GLM-4.1V-9B-Thinking凭借 9B 的模型尺寸,成功占领 Hugging Face Trending第一🎉
GLM-4.1V-Thinking是一款支持图像、视频、文档等多模态输入的通用推理型大模型,专为复杂认知任务设计。它在GLM-4V架构基础上引入“思维链推理机制(Chain-of-Thought Reasoning)”,采用“课程采样强化学习策略(RLCS, Reinforcement Learning with Curriculum Sampling)”,系统性提升模型跨模态因果推理能力与稳定性。
其轻量版GLM-4.1V-9B-Thinking模型参数控制在10B级别,在兼顾部署效率的同时实现性能突破。该模型在MMStar、MMMU-Pro、ChartQAPro、OSWorld等28项权威评测中,有23项达成10B级模型的最佳成绩,其中18项更是持平或超越参数量高达72B的Qwen-2.5-VL,充分展现了小体积模型的极限性能潜力。GLM-4.1V-9B-Thinking标志着GLM系列视觉模型实现从感知走向认知的关键跃迁。
【开源地址】Github:https://github.com/THUDM/GLM-4.1V-Thinking
Hugging Face:https://huggingface.co/THUDM/GLM-4.1V-9B-Thinking

Comments

十字鱼 2025-07-09

欢迎体验~ BV12q34zwEZS

♥ 6

凯文糕 2025-07-13

ollama supporting will make it more popular.

♥ 5

环境猫er 2025-07-17

确实不错,我写了 2 篇[呲牙]https://mp.weixin.qq.com/s/9WleuGBm3e8oL_XxgUGyjA

♥ 5

芒鞋踏剑行 2025-07-09

ollama没更新……

♥ 3

梦境蘑菇菌 2025-07-23

自打glm闭源,之后我就再也不用了。

♥ 1

oneds6 2025-07-13

做个3d吧,或者类似ollama这种,目前国内没人做的,而且竞争对手还少。

♥ 1

vista980992 2025-10-24

:-(?

无聊的人很多很多 2025-08-02

图片文字识别还是弱,还得强化下。理解图片是没什么问题

redforst 2025-08-01

能不能连入Claudecode里使用?

zxyzxy123 2025-07-22

9b做成这样蛮不错的

腊肉韭菜包 2025-07-12

我刚下的Qwen-2.5,岂不白瞎了[doge][doge][doge]

海宁智能化皮革城批零 2025-07-11

[呲牙][呲牙][呲牙]

Alnaschar 2025-07-10

牛逼的啊,狠狠学习了

追风赶月莫摆烂 2025-07-12

加油

闲云飞月 2025-07-10

进攻

切利和霍老 2025-07-09

slide是用mcp做的吧[doge]