ParScale:一种全新的大模型Scaling Law
合集 · 通义前哨站 (71)
-
【直播回放】ICLR 2025论文解读(上)——通义实验室篇
1:02:05
-
智能体工作流评估新框架:WorFBench
1:11
-
这是通义千问的来时路。
1:20
-
从单图到可驱动3D数字人生成技术讲解
15:23
-
有人问Qwen2.5-Omni 和VL的区别?
1:15
-
【直播回放】ICLR 2025论文解读(下)——通义实验室篇
1:27:46
-
通义万相2.1的3D VAE是什么?
2:03
-
多模态大模型解题新思路:mPLUG-Owl3
1:29
-
行业首发全栈MCP服务,尽在百炼平台~
0:42
-
通义万相2.1首尾帧生视频模型开源
1:29
-
【玩转MCP】手把手教你自定义部署MCP服务
1:23
-
【玩转MCP】手把手教你搭建专属MCP Agent
1:23
-
超写实3D数字人大模型(LAM)技术报告解读
1:57
-
表情、声音、说话风格一键复刻!
1:34
-
我们为千行百业而来。
0:23
-
Qwen3 来了!
0:40
-
Thinking Budget:让大模型灵活思考
1:20
-
Qwen3+MCP带来哪些新场景?
0:56
-
太好了,是Qwen的Deep Research,我们有救了
1:00
-
通义万相视频编辑统一模型VACE开源发布
1:07
-
【直播回放】通义万相视频编辑统一模型VACE开源
10:01
-
如果有Wan Day,它会是什么样子?
2:14
-
ZeroSearch:无需真实搜索也能激发模型搜索能力
2:42
-
今天来复习一下Qwen2.5-VL技术报告!
3:24
-
ParScale:一种全新的大模型Scaling Law
3:15
-
大模型如何持续进化,实现精准检索?
2:01
-
【直播回放】Qwen3-Embedding模型深度解析
59:14
-
语音识别怕噪声?CoGenAV 来破局!
2:40
-
在这里,了解通义千问的一切
0:37
-
微表情捕捉、潜台词翻译,AI“读心专家”就位!
1:36
-
理解画面捕捉细节,你的AI音效师来啦!
1:47
-
框架开源,无需邀约,即刻体验!
5:03
-
Qwen Vlo|描绘你关于世界的想象
0:57
-
10分钟,打造你的专属实时语音交互应用!
1:51
-
手机也能跑 Qwen3?手把手教你部署!
1:41
-
一句话玩转网页开发!
1:10
-
【直播回放】Ask Qwen3 Anything 2025年04月30日10点场
1:04:15
-
如何让AI有理有据地识别情绪?
52:16
-
来吧,上船,起航!
5:10
-
👂听说,Qwen3-Coder其实也能听懂大白话?
1:16
-
人人都是大导演!通义万相2.2来了!🤩
1:57
-
Github 5K+🌟WebAgent研究团队新作:WebShaper来啦
1:05
-
书画双全!Qwen-Image开源🖌
1:57
-
【直播回放】Qwen-Image技术报告解读和模型实战攻略01
2:04:47
-
音画传情 声启万相
1:05
-
什么呀?语音识别现在也要调监控啦🧐?
3:39
-
AgentScope1.0:终结智能体黑盒🗃️,打造生产级可控应用
4:03
-
🎙️ 开麦即真:CosyVoice 全面升级
1:41
-
不止入戏,更能入景🎬
1:20
-
说得更好、更准、更自然:Qwen3-TTS上线
2:35
-
原生全模态不降智
6:55
-
Qwen3-VL 看懂、理解并响应世界
2:03
-
多图编辑进化,万物皆可一键“同框”!
0:58
-
大就是好!Qwen3-Max 正式亮相
0:41
-
通义万相2.5:一句指令,玩转图像魔法
0:41
-
别让声音困住你的效率
0:44
-
通义万相2.5:一句话实现“Vibe PSing”!
0:47
-
通义万相2.5:让声音当你的视频“导演”!
0:48
-
通义万相2.5:让画面“声”动起来!
1:21
-
通义万相2.5:能听懂,也能准确执行!
0:54
-
Qwen3-Omni API上新:声形意合,令出智随
4:52
-
Fun-CosyVoice 3 重磅升级|更快、更准、更强表达力
1:15
-
Fun-ASR 全新升级|企业级抗干扰
1:21
-
「通义万相2.6」来啦!所有角色,听我指挥
0:39
-
Qwen-Image-Layered:下一代图像生成基础模型 🚀
0:51
-
进来复习!是谁8步推理1秒出图
0:55
-
【能干活的高情商语音搭子】
1:39
-
Qwen3-TTS上新,支持跨物种克隆音色!
3:19
-
Qwen-Image-2512 正式开源发布!
0:57
-
除夕!Qwen3.5来了!
1:16
-
Qwen-Audio-3.0-Realtime 发布:懂倾听,更聪明的实时语音方案
2:53
Description
近年来大型语言模型(LLMs)扩展的主流方法集中在参数扩展和推理时间扩展上,这些方法分别带来了显著的显卡开销和时间成本。通义实验室千问团队提出了一种新路线——并行扩展(PARSCALE),旨在通过增加模型的并行计算能力来提高推理效率,同时避免参数扩展和推理时间扩展带来的训练成本。 🔥 PARSCALE通过在输入数据上应用P个不同的可学习变换,并在训练和推理阶段以并行方式执行前向传播,最终动态聚合P个输出。这种方法可以通过重复利用现有参数实现高效的并行计算扩展,适用于任何模型结构、优化过程、数据或任务。 🔥 理论分析表明,PARSCALE的损失可能遵循类似于Chinchilla扩展定律的幂律关系。通过大规模预训练实验团队拟合出一个新的并行扩展定律,表明将模型并行化为P个流相当于将模型参数扩展O(log P)倍。 🔥 实验结果表明,PARSCALE相比参数扩展具有更高的推理效率,特别是在低资源边缘部署场景中表现优异。例如,对于1.6B参数的模型,使用PARSCALE扩展到P=8时,其内存增长仅为参数扩展的1/22,延迟增长仅为1/6。此外,通过两阶段训练策略,PARSCALE的训练成本也显著降低。在下游任务上的实验进一步证明了PARSCALE的有效性,尤其是在推理密集型任务(如数学和编程)中表现出色。 🔥 总体而言,PARSCALE提供了一种高效且灵活的语言模型扩展方法,不仅减少了训练和推理成本,还为理解计算与参数在模型容量中的作用提供了新的视角。 📚论文:arxiv.org/abs/2505.10475 模型:modelscope.cn/papers/2505.10475 体验:huggingface.co/spaces/ParScale/Parallel_Scaling_Law
Comments
你家的qwen相当死板,要幽默又不正面回答问题,一个网站死板,一个APP过于幽默
♥ 21 ↩ 9
赶紧的,8g显存设备苦大显存久已
♥ 8
期待qwen3.5[打call][打call][打call]
♥ 4
说白了就是让ai像一些人一样从更多的角度思考问题,得出结论
♥ 2
QWEN依然是一个很好的模型,但让它给cot提出评判指标来保证可行性还是太难为她了
♥ 2
😊❤️💔Qwen……
♥ 2
发了这么多新技术,期待Qwen3.5[打call]
♥ 2
关注了这么段时间就发了这么多不明觉厉的技术,感觉哪个都能让你自家的qwen大进步,结果现在实际体验让deepseek薄纱,对比过好多次真是不能用的水平。。。
♥ 2 ↩ 6
类似多头注意力和多个卷积核的思路?
♥ 2 ↩ 3
前两步算是prompt tuning+moe的思路嘛
♥ 1 ↩ 1
但是这个结果,从原来传统QWEN2.5和现在新并行参数量的模型相比,这个数学的结果还是弱于传统的QWEN,这个还是反应这个方法预训练的困难,还是后面需要探索更多的方法进行训练[OK]。后续继续跟踪[打call]
啥时候本地模型能达到gpt3.5的程度就行。我显存就8g,内存64g[doge]
↩ 1
想请问下,并行扩展策略是否属于计算量的一种新的利用方式呢,并行扩展策略对loss的scaling law是否等价于计算量对loss的scaling law一致呢[笑哭]
↩ 2
没太听懂[笑哭]
↩ 2
牛![喜欢]
想问问具体来说input的转换和output的聚合具体来说是怎么做的呢?我看input那里好像是加了个克训练的prompt?输出的话就是直接用个全连接层来聚合?
↩ 1
看过作者的分享 其的本质在于提供同参并行提高并行计算量 原因是作者在研究diffusion时,发现变量劣化前后的计算结果加权要比直接计算来得好,猜测可能是因为并行计算导致的
能讲一下这个和束搜索的区别吗?[脸红]感觉有点意思。。
↩ 1
看上去就是在推理时加了batch size?如何不显著增加计算开销的?
↩ 3
虽然没有完全听懂,不过感觉会是很厉害的研究成果。