CogVLM2:第二代视觉大模型,19B即可比肩 GPT-4V

合集 · 多模态模型 (7)

  1. 46:40
    CogVLM2:第二代视觉大模型,19B即可比肩 GPT-4V
  2. 1:31
    全新GLM-4v-plus,更强的视频理解能力
  3. 3:24
    AI 的「phone use」时刻也来了
  4. 2:33
    GLM-4-Voice:国内首个端到端语音模型
  5. 2:04:49
    从 Sora 看多模态大模型的未来
  6. 1:35
    发布即开源!多模态大模型正在从“看得见”走向“看得懂、想得通”。
  7. 1:25:15
    开源通用视觉语言模型GLM-4.1V-Thinking技术分享
Description
近期将推出新一代多模态大模型 CogVLM2 ,与上一代的 CogVLM 模型相比,CogVLM2 系列模型具有以下改进:
在不损失任何通用能力的前提下,在许多关键指标上有了显著提升,如在 OCRbench 基准上性能提升32%,在TextVQA基准上性能提升21.9%,且模型具备了较强的文档图像理解能力(DocVQA)等;
支持 8K 文本长度;
支持高达 1344 * 1344 的图像分辨率;
提供支持中英文双语的开源模型版本。

Comments

芒鞋踏剑行 2024-05-29

我试了下,我愿称之为当前中文手写OCR的真神,对中文手写体识别成功率,超过minicpm-llama3-2.5版本,超过百度飞桨开源版本,即使我使用的测试文件字迹比较潦草也超过95%的准确率,mini2.5才70%左右, 在提取结构化数据时有逻辑缺陷,特别是复杂的中式表格理解其字段关系并不准确,对印章的识别不如mini2.5 很不错,加油!

♥ 38 ↩ 5

LingeringLz 2024-05-29

省流,这个网站可以试用: http://36.103.203.44:7861

♥ 16 ↩ 3

rainwater111 2024-05-29

我已部署成功单卡运行

♥ 10 ↩ 7

AI总结视频 2024-05-29

课代表总结:COVM2是清华大学和智谱AI联合研发的开源大模型,拥有19B参数,性能可媲美GPT-4V。直播分为两部分:王维翰学长讲解模型原理、训练过程和综合成绩;主播介绍模型应用和快速上手方法,以及团队的未来计划和联系方式。COVM2在多模态任务上表现出色,通过改进模型架构和训练策略,解决了多模态模型的一些关键问题,如图片中的幻觉、分辨率限制和中文理解等。模型还具备与GUI交互的能力,且在OCR、视觉问答和图表分析等方面有显著提升。团队提供了详细的模型使用资料和硬件配置建议,帮助用户快速部署和微调模型。此外,还提到了与其他模型的对比和后续的优化计划。

♥ 10

一汁手套 2024-05-29

api接口用起来很顺畅,稍加修改即可集群部署;只是19B的模型除int4基本上不了单张消费级显卡,希望多多发展!

♥ 6 ↩ 5

芒鞋踏剑行 2024-05-29

我以此文举例,在minicpm2.5 与飞桨等其他模型做测试的结果都不如本模型,感兴趣的可以试一下,以下为本模型输出内容, "本年度思想工作总结": "今年4月份从前负责局办公室打字文印工作,认真做好领导和各科室交办的各项文字打印、复印、传真工作,做到尽可能快、准、好。认真开展自我剖析,认清自己工作中的不足,积极提高自我综合素质和业务能力。4月份以往主要从事档案管理工作,收集、整理、归纳2005年的文字档案、照片档案和会计档案,做到有序、整齐、到位,为保存和以后查寻档案工作奠定了基础,并整理出往年的会计档案,完善档案室各种档案的编排、记录、归纳工作,我局接受了四川省档案局的考核,并荣获了四川省档案工作规范化管理二级单位。"

♥ 5 ↩ 2

放少年的羊儿 2024-05-29

٩(๑ᵒ̴̶̷͈᷄ᗨᵒ̴̶̷͈᷅)و 好厉害

♥ 5

Isla7940 2024-05-29

[笑哭][笑哭][笑哭][笑哭]

♥ 4

Lil_Wong_yall 2024-06-04

Cogvlm的语言模型为什么不用glm4 而是 vicuna/llama3

♥ 2

浮芒Friman 2024-05-29

纯文本通用能力感觉下降不少啊

♥ 2

lvjiajjj 2024-05-31

glm-4仍需训练啊,根本没GPT-4强,包括中文

♥ 1

粘土火星 2024-05-31

写了个Win10跑通的笔记,结果改了好几版叔叔不让发可还行

♥ 1 ↩ 1

MrPKJ 2024-05-31

OCR效果在LLM里确实出众,很少出现幻觉(我的识别场景是小学生手写体识别)。而且能概率识别出拼音(eg: can 烂的春天)。但是准确率还是不行,而且无法体现音调,比如à。 前者可能是汉子夹杂拼音的样本太少,后者应该是token就没有这种à,所以也无法输出?可以的话希望交流一下~

♥ 1

Canny-蜡笔小楚 2024-05-31

请问一下,预训练的时候,会调整LLama3的参数吗?不太能理解为什么LLama3不支持中文输出,但是cogvlm2支持中文输入和输出? 指令对其阶段应该是只调整视觉模型和expert模型和FFN的参数对吧?

♥ 1 ↩ 1

AI视频小助理 2024-05-30

实名羡慕up这溢出屏幕的才华[点赞][点赞][点赞],YYDS!快来一键三连吧[热词系列_优雅] 一、开源模型COVM2的基本原理和训练过程,以及其在多模态领域的应用和优势,同时探讨了该模型在实际应用中可能面临的问题和解决方案。 00:01 - 介绍COVM2模型,19B参数可比肩GBT4V 02:23 - 多模态大模型存在关键痛点,如幻觉、中文识别等 06:00 - 引入高分辨率cross弹性分支,减少计算开销,加速模型推理 二、靠谱VRM2模型的设计和优化,包括视觉和语言特征的调节、位置编码的处理以及视觉编码器的选用等。 08:20 - 只激活模型参数中的一部分,不增加计算开销 08:54 - 模型在额数据以上的分数平均高出2%左右 11:40 - 使用向量来编码图像的位置信息,避免位置编码的二维性丢失 三、在多模态训练过程中,通过学习中文能力,使得模型在处理中文问题时更加得心应手。此外,我们还介绍了模型在应用方面的表现和配套措施。 16:41 - 可靠的视觉模型可以学习中文能力,提升自制中文能力 21:02 - 可靠的视觉模型在应用实践方面有显著提升,包括经典案例和多模态模型应用 24:30 - 可靠的视觉模型提供中文能力,可用于图片细节识别和文件提取等应用场景 四、一个多模态模型的演示,包括文字识别、对话能力等。同时还提供了模型的调用代码和硬件配置要求等信息。 25:01 - 演示中文对话能力的模型版本 26:00 - OCR和手写体识别等功能的演示 28:42 - 如何快速上手和部署CooVLM2模型,提供了代码和模型地址 五、关于模型加速和改进的计划,以及模型与gm4V的区别和应用场景。同时,讨论了图像位置编码、流程图、目标检测等问题。 33:20 - 显卡显存节约优化,提供模型微调部分 36:00 - 推荐使用本地开源模型,可进行定制化和微调 38:18 - 欢迎在GITHUB上提出PR和建议,提供专业回答和优化改进 六、使用chat格式数据集进行模型微调的方法,以及该模型对多图对话和视频序列的支持情况,同时解释了为什么使用拉玛38B而不是拉玛370B。 41:44 - 模型能够控制不被带偏状态 42:23 - 使用chat格式制作数据集,微调模型 --以上内容由模型基于视频内容生成,仅供参考。视频总结、高能空降欢迎召唤热心市民@AI视频小助理

♥ 1

Lil_Wong_yall 2024-05-30

唯一开源真神[微笑]

♥ 1

光阴如流 2024-05-29

加油加油

♥ 1

梦幻泡影ywy 2024-05-29

你们啥意思有gpt -4o 啊,那才叫牛逼!!!

♥ 1

放少年的羊儿 2024-05-29

好奇问一下,质谱清言对接的模型是这个吗?我看也能有图片识别和绘画等功能

♥ 1 ↩ 3

ViatorSun 2024-07-25

有人在win系统跑通么,我一直报错[笑哭],cformer和triton已经成功安装了,还是出错,报Failed to find C compiler. Please specify via CC environment variable.,安装了gcc,又报其他错误[笑哭][笑哭][笑哭]