「官方教程」GLM-4-9B 实战部署和微调

合集 · 模型部署和微调 (9)

  1. 42:53
    「官方教程」GLM-4-9B 实战部署和微调
  2. 1:08:52
    探索GLM-4-9B开源模型:ITREX — LLM工具实战
  3. 2:01
    ChatGLM3 一键安装,懒人专属
  4. 33:26
    低配置部署 ChatGLM3-6B | 智谱 × 魔搭社区
  5. 57:09
    【官方教程】ChatGLM3-6B 部署和微调(Function Call、Code Interpreter、Agent)
  6. 1:07:45
    【官方教程】ChatGLM 的 Prompt 工程实践,真实案例详解
  7. 1:03:23
    【官方教程】ChatGLM2-6B 部署与微调
  8. 1:10:13
    【官方教程】ChatGLM + LangChain 实践培训
  9. 1:18:45
    【官方教程】ChatGLM-6B 微调:P-Tuning,LoRA,Full parameter
Description
自 2023 年 3 月 14 日开源 ChatGLM-6B 以来,GLM 系列模型受到广泛关注和认可。特别是 ChatGLM3-6B开源以后,开发者对智谱AI 第四代模型的开源充满期待。

为了使小模型(10B 以下)具备更加强大的能力,GLM 技术团队进行了大量探索工作。经过近半年的探索,我们推出了第四代 GLM 系列开源模型:GLM-4-9B。

在预训练方面,我们引入了大语言模型进入数据筛选流程,最终获得了 10T 高质量多语言数据,数据量是 ChatGLM3-6B 模型的 3 倍以上。同时,我们采用了 FP8 技术进行高效的预训练,相较于第三代模型,训练效率提高了 3.5 倍。在有限显存的情况下,我们探索了性能的极限,并发现 6B 模型性能有限。因此,在考虑到大多数用户的显存大小后,我们将模型规模提升至 9B,并将预训练计算量增加了 5 倍。

综合以上技术升级和其他经验,GLM-4-9B 模型具备了更强大的推理性能、更长的上下文处理能力、多语言、多模态和 All Tools 等突出能力。GLM-4-9B 系列模型包括:基础版本 GLM-4-9B(8K)、对话版本 GLM-4-9B-Chat(128K)、超长上下文版本 GLM-4-9B-Chat-1M(1M)和多模态版本 GLM-4V-9B-Chat(8K)。

 GitHub仓库链接:https://github.com/THUDM/GLM-4

本期分享嘉宾:@zR_ZYX

Comments

AI视频小助理 2024-06-27

--本内容由 @完美困惑度 大佬下凡召唤,热心市民@AI视频小助理闪现赶来 一、开源模型的实战部署和微调,包括模型下载、部署、微调和工具调用等,同时分享了收到大家需求和改进的内容。 00:01 - 介绍GM4-9B开源模型的实战部署和微调 02:01 - 下载模型的注意事项和不同模型的区别 06:09 - OpenAI接口的改进和建议使用V2M相关操作来部署 二、VLLM底座的基本demo的使用方法以及注意事项,包括显存限制、微调模型、模型推理等。同时还提到了一些常见问题的解决方法。 08:22 - 设置8K是因为显存限制,推荐微调模型使用 10:15 - 王者demo集成了gm4开源模型和AUTOOLS能力 13:05 - 推荐使用bf16进行推理,勿调用LP16进行微调模型训练 三、在模型部署中需要注意的几个点,包括显存限制、数据集构建和模型微调等。同时还讲解了如何使用flash attention和修改代码等。 16:40 - 需要注意显卡数量和模型长度 18:20 - 数据集有非工具微调和工具微调两种类型 20:48 - 数据处理单元是微调最重要的部分,需要重写数据单元 四、如何通过微调配置文件来更改LOLA be tning和SFT的学习力和训练、验证、测试集等文件,以及数据集的格式和注意事项。 25:02 - 可以修改学习力以及训练的文件,包括测试集的文件 26:26 - 代码中不会改动,只需要指定数据集的位置即可推理 30:01 - 正在适配欧AMA和拉玛CPP,以及gm4V9B的VM推比,其他需求正在调研和设计阶段 五、一个简单的微调效果实现过程,包括模型推理和保存点导入等操作。同时提到注意事项和建议,以及一些常见问题的解答。 33:20 - 实现一个简单效果的微调,推理过程简单。 35:25 - 建议使用其他微调方案,因为这个方案不是高效的。 38:38 - gm49B不支持多角色对话应用,但GM4支持多达28种小语种。 六、一个语音识别框架,该框架可以进行微调,适用于LOLA和STOK等语音识别任务,同时作者也提到了该框架在内存和显存方面的要求。 41:40 - 该框架不需要额外的操作,可微调性高 42:13 - 在GIT 实名羡慕up这溢出屏幕的才华[点赞][点赞][点赞],YYDS!快来一键三连吧[热词系列_优雅]

♥ 10

-99740 2024-08-19

能不能换个人,说话都说不清楚,简直了

♥ 9 ↩ 1

我看过你的背影 2024-06-26

Glm4v有开官方int4么

♥ 6 ↩ 1

deathado 2024-06-26

我用L20微调glm3-9b-chat的时候会爆显存,而且是在正常跑了1000多个steps之后才出现,显存占用从20多g一下冲到40多,这个实在是有点出乎意料

♥ 5 ↩ 2

akulamatata_bil 2024-07-17

废话太多

♥ 4

弃天帝大爷 2024-06-27

万能的官方glm5,啥时候出,7月9号gpt就关闭api接口了,他当天关闭,你当天开源glm5,当天打gpt的脸,当天上热门,我们需要glm5

♥ 4 ↩ 1

君子不立危墙 2024-07-15

微调出现loss为0 大概率是fp16精度微调: 想问下大佬,不支持bf16的机器是不是就没法微调了啊,我用的T4

♥ 3 ↩ 4

yu8500 2024-06-26

8卡A100 80G吗。。

♥ 3 ↩ 5

zR_ZYX 2024-06-27

6. 所有部署文档和简单教程均在github仓库。更新模型文件的时候可以关闭lfs,模型权重不需要重新下载。

♥ 2

今晚黄浦江见 2024-11-09

ptuing v2微调 为什么loss降不下去呀 一直在2.0左右,而且微调的模型输出也不正确,你们有出现这种现象的吗

♥ 1 ↩ 1

今晚黄浦江见 2024-11-07

使用 `deepspeed` 作为加速方案,48g内存的A6000为什么会不够呢? 只是chat-9b的lora微调,什么参数都没动

♥ 1 ↩ 1

今晚黄浦江见 2024-11-07

system中的content会被覆盖,那自己制定的提示词该放到什么位置呢? 我需要限制微调大模型的输出格式

♥ 1 ↩ 1

普拉斯理 2024-08-31

这个模型可以从ollama上面下载吗?

♥ 1

alimeituan 2024-08-31

有PPT分享么?

♥ 1

bili--mmm 2024-08-15

微调报错DatasetGenerationError: An error occurred while generating the dataset 是我数据集格式不对吗

♥ 1 ↩ 1

大海常心 2024-08-10

两张t4能微调 glm4-9b chat么

♥ 1

星见雅舔友会会长 2024-07-13

会上架ollama吗

♥ 1

--魅影-- 2024-07-10

请问大佬,微调的数据集从哪里下载呢?

♥ 1 ↩ 1

zR_ZYX 2024-07-02

用BF16,然后微调长度拉长到你的数据集单条数据的长度以上

♥ 1