发布即开源!多模态大模型正在从“看得见”走向“看得懂、想得通”。
合集 · 多模态模型 (7)
Description
GLM-4.1V-9B-Thinking引入 课程采样强化学习策略,在多个复杂推理任务中实现能力突破,整体性能达到 10B 级别视觉语言模型的领先水平。在 18 项权威评测中,GLM-4.1V-9B-Thinking 的表现已可比肩甚至超越参数量高达 72B的 Qwen2.5-VL-72B,充分展示出结构设计与训练策略的先进性与效率。 论文链接:https://arxiv.org/abs/2507.01006 Github:https://github.com/THUDM/GLM-4.1V-Thinking
Comments
希望能gguf,个人电脑还是gguf比较简单
♥ 52 ↩ 11
欢迎体验 BV12q34zwEZS
♥ 31 ↩ 6
上ollama吗?
♥ 18 ↩ 6
之前GLM效果挺一般的,我用来识别文旅短片,一直循环语句,效果不如那会的qwen2.5vl,更不如gemini2 flash
♥ 16 ↩ 3
那么你ChatGLM能不能添加更多能力:理解音乐,分析音乐的谱子,解析音乐,解析视频里的音乐,生成音乐呢?[吃瓜]AI音乐理解可是国产AI的短板,CHATGLM可要做起来呀!
♥ 10 ↩ 1
这个视频的bgm是不是有点怪[doge]
♥ 7
网页版试了一下感觉。。emm
♥ 6 ↩ 5
AI课代表总结:视频通过四个场景验证BigModel的多模态能力——1) 分析足球赛事技术细节与战术配合;2) 解读科幻电影情节并预判剧情走向;3) 根据商品标价自动计算购物总费用;4) 依据界面截图生成对应React代码框架。全程展现模型对图文视频信息的理解、推理与跨模态生成能力。 ✨ 本喵都要惊掉下巴啦!这模型简直是全能型选手,从绿茵场到编程界统统拿捏得死死的~ --内容由@AI视频总结 生成,仅供参考【很棒的视频,快给up主点赞】
♥ 2 ↩ 3
军用是不是无人机可以推测敌人动向指挥地面作战了。
♥ 1
视频的类GRPO训练,好东西
♥ 1
你们的混合推理模型还没有出来吗
♥ 1
挣钱吗
模型知不知道动物是怎么知道哪个是食物的如何辨认
看得懂什么,又不是讲开发的
我当学生的时候要是做数学题有这些就好了,要么没答案要么只有答案。[笑哭]
网页版性能跟千问和gemini比落后太多了,连网页版都做不好,谁又兴趣关心你的新模型的指标,很影响印象
闷声发大财,看好
最长可以总结多长的视频,可以给视频放针找出来吗
牛逼牛逼
哇哦,这么厉害👍🏻