将大模型的输出长度扩展至万级丨技术解读
合集 · Long系列 (3)
Description
随着大语言模型的发展,许多模型已经能够处理超过100k+ tokens的输入上下文。然而,这些模型在生成长文本时,普遍存在输出长度受限的问题。 如何才能让模型拥有更强的长文本输出能力呢?我们发现,模型输出长度受限的主要原因在于,监督微调(SFT)数据集缺乏足够长的输出样例。 GitHub链接:https://github.com/THUDM/LongWriter 快速上手:https://zhipu-ai.feishu.cn/wiki/RiF0wsjK0imjGekisUQcNSUpnsd?fromScene=spaceOverview 文字解读:https://mp.weixin.qq.com/s/o0NhmVDAN0qK64Q7pOTk2Q
Comments
可算救了我了,我们的产品需要模型输出一节的文本,以前的做法需要2~3轮输出才能满足字数要求,而且多轮输出的语义连贯性非常差
♥ 5
热乎哒[星星眼]
♥ 2
实验做得也太不严谨了吧... 全和general LLM比较,不和General LLM+Planning+Write进行比较... 因为他的model比general llm在多做了两个事情:SFT/DPO+Planning/write. 而两个核心点都没有相应的baseline比较
♥ 1
目前gpt4o和gpt4o mini最新版本可以最大输出16k tokens,实测在提示词工程下,效果还是不错的1.5万字大表格非常好。
♥ 1 ↩ 2
现在有没有升级,效果更好的,感觉豆包1.5 pro 32不错,有没同类开源项目
LongWriter-6k训练数据集公开了吗?
博主,能否在魔塔社区也上传一份训练数据集,方便国内用户使用。
博主能否做出一个离线部署安装包分享出来,我觉得用于公文写作是很好的一个选择!
↩ 1
谁能解释一下反向构造?最终输出的是文本还是指令?我都有文本了还需要它干啥?
↩ 1