CogVLM2:第二代视觉大模型,19B即可比肩 GPT-4V
合集 · 多模态模型 (7)
Description
近期将推出新一代多模态大模型 CogVLM2 ,与上一代的 CogVLM 模型相比,CogVLM2 系列模型具有以下改进: 在不损失任何通用能力的前提下,在许多关键指标上有了显著提升,如在 OCRbench 基准上性能提升32%,在TextVQA基准上性能提升21.9%,且模型具备了较强的文档图像理解能力(DocVQA)等; 支持 8K 文本长度; 支持高达 1344 * 1344 的图像分辨率; 提供支持中英文双语的开源模型版本。
Comments
我试了下,我愿称之为当前中文手写OCR的真神,对中文手写体识别成功率,超过minicpm-llama3-2.5版本,超过百度飞桨开源版本,即使我使用的测试文件字迹比较潦草也超过95%的准确率,mini2.5才70%左右, 在提取结构化数据时有逻辑缺陷,特别是复杂的中式表格理解其字段关系并不准确,对印章的识别不如mini2.5 很不错,加油!
♥ 38 ↩ 5
省流,这个网站可以试用: http://36.103.203.44:7861
♥ 16 ↩ 3
我已部署成功单卡运行
♥ 10 ↩ 7
课代表总结:COVM2是清华大学和智谱AI联合研发的开源大模型,拥有19B参数,性能可媲美GPT-4V。直播分为两部分:王维翰学长讲解模型原理、训练过程和综合成绩;主播介绍模型应用和快速上手方法,以及团队的未来计划和联系方式。COVM2在多模态任务上表现出色,通过改进模型架构和训练策略,解决了多模态模型的一些关键问题,如图片中的幻觉、分辨率限制和中文理解等。模型还具备与GUI交互的能力,且在OCR、视觉问答和图表分析等方面有显著提升。团队提供了详细的模型使用资料和硬件配置建议,帮助用户快速部署和微调模型。此外,还提到了与其他模型的对比和后续的优化计划。
♥ 10
api接口用起来很顺畅,稍加修改即可集群部署;只是19B的模型除int4基本上不了单张消费级显卡,希望多多发展!
♥ 6 ↩ 5
我以此文举例,在minicpm2.5 与飞桨等其他模型做测试的结果都不如本模型,感兴趣的可以试一下,以下为本模型输出内容, "本年度思想工作总结": "今年4月份从前负责局办公室打字文印工作,认真做好领导和各科室交办的各项文字打印、复印、传真工作,做到尽可能快、准、好。认真开展自我剖析,认清自己工作中的不足,积极提高自我综合素质和业务能力。4月份以往主要从事档案管理工作,收集、整理、归纳2005年的文字档案、照片档案和会计档案,做到有序、整齐、到位,为保存和以后查寻档案工作奠定了基础,并整理出往年的会计档案,完善档案室各种档案的编排、记录、归纳工作,我局接受了四川省档案局的考核,并荣获了四川省档案工作规范化管理二级单位。"
♥ 5 ↩ 2
٩(๑ᵒ̴̶̷͈᷄ᗨᵒ̴̶̷͈᷅)و 好厉害
♥ 5
[笑哭][笑哭][笑哭][笑哭]
♥ 4
Cogvlm的语言模型为什么不用glm4 而是 vicuna/llama3
♥ 2
纯文本通用能力感觉下降不少啊
♥ 2
glm-4仍需训练啊,根本没GPT-4强,包括中文
♥ 1
写了个Win10跑通的笔记,结果改了好几版叔叔不让发可还行
♥ 1 ↩ 1
OCR效果在LLM里确实出众,很少出现幻觉(我的识别场景是小学生手写体识别)。而且能概率识别出拼音(eg: can 烂的春天)。但是准确率还是不行,而且无法体现音调,比如à。 前者可能是汉子夹杂拼音的样本太少,后者应该是token就没有这种à,所以也无法输出?可以的话希望交流一下~
♥ 1
请问一下,预训练的时候,会调整LLama3的参数吗?不太能理解为什么LLama3不支持中文输出,但是cogvlm2支持中文输入和输出? 指令对其阶段应该是只调整视觉模型和expert模型和FFN的参数对吧?
♥ 1 ↩ 1
实名羡慕up这溢出屏幕的才华[点赞][点赞][点赞],YYDS!快来一键三连吧[热词系列_优雅] 一、开源模型COVM2的基本原理和训练过程,以及其在多模态领域的应用和优势,同时探讨了该模型在实际应用中可能面临的问题和解决方案。 00:01 - 介绍COVM2模型,19B参数可比肩GBT4V 02:23 - 多模态大模型存在关键痛点,如幻觉、中文识别等 06:00 - 引入高分辨率cross弹性分支,减少计算开销,加速模型推理 二、靠谱VRM2模型的设计和优化,包括视觉和语言特征的调节、位置编码的处理以及视觉编码器的选用等。 08:20 - 只激活模型参数中的一部分,不增加计算开销 08:54 - 模型在额数据以上的分数平均高出2%左右 11:40 - 使用向量来编码图像的位置信息,避免位置编码的二维性丢失 三、在多模态训练过程中,通过学习中文能力,使得模型在处理中文问题时更加得心应手。此外,我们还介绍了模型在应用方面的表现和配套措施。 16:41 - 可靠的视觉模型可以学习中文能力,提升自制中文能力 21:02 - 可靠的视觉模型在应用实践方面有显著提升,包括经典案例和多模态模型应用 24:30 - 可靠的视觉模型提供中文能力,可用于图片细节识别和文件提取等应用场景 四、一个多模态模型的演示,包括文字识别、对话能力等。同时还提供了模型的调用代码和硬件配置要求等信息。 25:01 - 演示中文对话能力的模型版本 26:00 - OCR和手写体识别等功能的演示 28:42 - 如何快速上手和部署CooVLM2模型,提供了代码和模型地址 五、关于模型加速和改进的计划,以及模型与gm4V的区别和应用场景。同时,讨论了图像位置编码、流程图、目标检测等问题。 33:20 - 显卡显存节约优化,提供模型微调部分 36:00 - 推荐使用本地开源模型,可进行定制化和微调 38:18 - 欢迎在GITHUB上提出PR和建议,提供专业回答和优化改进 六、使用chat格式数据集进行模型微调的方法,以及该模型对多图对话和视频序列的支持情况,同时解释了为什么使用拉玛38B而不是拉玛370B。 41:44 - 模型能够控制不被带偏状态 42:23 - 使用chat格式制作数据集,微调模型 --以上内容由模型基于视频内容生成,仅供参考。视频总结、高能空降欢迎召唤热心市民@AI视频小助理
♥ 1
唯一开源真神[微笑]
♥ 1
加油加油
♥ 1
你们啥意思有gpt -4o 啊,那才叫牛逼!!!
♥ 1
好奇问一下,质谱清言对接的模型是这个吗?我看也能有图片识别和绘画等功能
♥ 1 ↩ 3
有人在win系统跑通么,我一直报错[笑哭],cformer和triton已经成功安装了,还是出错,报Failed to find C compiler. Please specify via CC environment variable.,安装了gcc,又报其他错误[笑哭][笑哭][笑哭]