通义万相2.1的3D VAE是什么?

合集 · 通义前哨站 (71)

  1. 1:02:05
    【直播回放】ICLR 2025论文解读(上)——通义实验室篇
  2. 1:11
    智能体工作流评估新框架:WorFBench
  3. 1:20
    这是通义千问的来时路。
  4. 15:23
    从单图到可驱动3D数字人生成技术讲解
  5. 1:15
    有人问Qwen2.5-Omni 和VL的区别?
  6. 1:27:46
    【直播回放】ICLR 2025论文解读(下)——通义实验室篇
  7. 2:03
    通义万相2.1的3D VAE是什么?
  8. 1:29
    多模态大模型解题新思路:mPLUG-Owl3
  9. 0:42
    行业首发全栈MCP服务,尽在百炼平台~
  10. 1:29
    通义万相2.1首尾帧生视频模型开源
  11. 1:23
    【玩转MCP】手把手教你自定义部署MCP服务
  12. 1:23
    【玩转MCP】手把手教你搭建专属MCP Agent
  13. 1:57
    超写实3D数字人大模型(LAM)技术报告解读
  14. 1:34
    表情、声音、说话风格一键复刻!
  15. 0:23
    我们为千行百业而来。
  16. 0:40
    Qwen3 来了!
  17. 1:20
    Thinking Budget:让大模型灵活思考
  18. 0:56
    Qwen3+MCP带来哪些新场景?
  19. 1:00
    太好了,是Qwen的Deep Research,我们有救了
  20. 1:07
    通义万相视频编辑统一模型VACE开源发布
  21. 10:01
    【直播回放】通义万相视频编辑统一模型VACE开源
  22. 2:14
    如果有Wan Day,它会是什么样子?
  23. 2:42
    ZeroSearch:无需真实搜索也能激发模型搜索能力
  24. 3:24
    今天来复习一下Qwen2.5-VL技术报告!
  25. 3:15
    ParScale:一种全新的大模型Scaling Law
  26. 2:01
    大模型如何持续进化,实现精准检索?
  27. 59:14
    【直播回放】Qwen3-Embedding模型深度解析
  28. 2:40
    语音识别怕噪声?CoGenAV 来破局!
  29. 0:37
    在这里,了解通义千问的一切
  30. 1:36
    微表情捕捉、潜台词翻译,AI“读心专家”就位!
  31. 1:47
    理解画面捕捉细节,你的AI音效师来啦!
  32. 5:03
    框架开源,无需邀约,即刻体验!
  33. 0:57
    Qwen Vlo|描绘你关于世界的想象
  34. 1:51
    10分钟,打造你的专属实时语音交互应用!
  35. 1:41
    手机也能跑 Qwen3?手把手教你部署!
  36. 1:10
    一句话玩转网页开发!
  37. 1:04:15
    【直播回放】Ask Qwen3 Anything 2025年04月30日10点场
  38. 52:16
    如何让AI有理有据地识别情绪?
  39. 5:10
    来吧,上船,起航!
  40. 1:16
    👂听说,Qwen3-Coder其实也能听懂大白话?
  41. 1:57
    人人都是大导演!通义万相2.2来了!🤩
  42. 1:05
    Github 5K+🌟WebAgent研究团队新作:WebShaper来啦
  43. 1:57
    书画双全!Qwen-Image开源🖌
  44. 2:04:47
    【直播回放】Qwen-Image技术报告解读和模型实战攻略01
  45. 1:05
    音画传情 声启万相
  46. 3:39
    什么呀?语音识别现在也要调监控啦🧐?
  47. 4:03
    AgentScope1.0:终结智能体黑盒🗃️,打造生产级可控应用
  48. 1:41
    🎙️ 开麦即真:CosyVoice 全面升级
  49. 1:20
    不止入戏,更能入景🎬
  50. 2:35
    说得更好、更准、更自然:Qwen3-TTS上线
  51. 6:55
    原生全模态不降智
  52. 2:03
    Qwen3-VL 看懂、理解并响应世界
  53. 0:58
    多图编辑进化,万物皆可一键“同框”!
  54. 0:41
    大就是好!Qwen3-Max 正式亮相
  55. 0:41
    通义万相2.5:一句指令,玩转图像魔法
  56. 0:44
    别让声音困住你的效率
  57. 0:47
    通义万相2.5:一句话实现“Vibe PSing”!
  58. 0:48
    通义万相2.5:让声音当你的视频“导演”!
  59. 1:21
    通义万相2.5:让画面“声”动起来!
  60. 0:54
    通义万相2.5:能听懂,也能准确执行!
  61. 4:52
    Qwen3-Omni API上新:声形意合,令出智随
  62. 1:15
    Fun-CosyVoice 3 重磅升级|更快、更准、更强表达力
  63. 1:21
    Fun-ASR 全新升级|企业级抗干扰
  64. 0:39
    「通义万相2.6」来啦!所有角色,听我指挥
  65. 0:51
    Qwen-Image-Layered:下一代图像生成基础模型 🚀
  66. 0:55
    进来复习!是谁8步推理1秒出图
  67. 1:39
    【能干活的高情商语音搭子】
  68. 3:19
    Qwen3-TTS上新,支持跨物种克隆音色!
  69. 0:57
    Qwen-Image-2512 正式开源发布!
  70. 1:16
    除夕!Qwen3.5来了!
  71. 2:53
    Qwen-Audio-3.0-Realtime 发布:懂倾听,更聪明的实时语音方案
Description
3D VAE模块是通义万相2.1的一个核心模块,在目前视频生成领域广泛使用,通过对视频进行隐空间压缩可以在接近无损的情况下,有效地降低视频生成的资源占用,进一步地发掘生成视频的长度和分辨率潜力。

Comments

十字鱼 2025-04-10

原来Qwen的正确念法是“坤”

♥ 117 ↩ 9

梨花酒酿 2025-04-10

问个小知识,3d vae的符号,一般用“T+1-〉(T/4)+1”表示对帧维度的压缩,这里“+1”符号的作用,是为了强调输入只有一帧时,输出的特征也只有一帧吗[笑哭]

♥ 18 ↩ 8

EMERGENCYCALLSON 2025-04-10

冷知识:wan2.1在发布前几个小时叫wanx(

♥ 14 ↩ 1

阿某AM 2025-04-10

看到vae首先想到了许嵩[笑哭]

♥ 5

61b的父亲刘农 2025-04-11

无恶意,但是看了看你们这个3d vae的介绍,感觉跟CogVideoX的差不多啊,是不是现在各家生成模型都用的这一套[笑哭]

♥ 5 ↩ 1

快起床懒虫 2025-04-11

捉个虫,虽然时间压4,空间压8,但是c的维度从3变成了16,总压缩率并不是256 [doge]

♥ 3 ↩ 1

Manist 2025-04-10

请问为什么每个chunk会缓存最后两帧的特征?只缓存2帧有什么含义吗?

♥ 3 ↩ 2

硬梆梆棒棒糖 2025-04-13

qwen念坤啊,原来你也是我们ikun[doge]

♥ 3 ↩ 1

__logos_ 2025-04-11

通义会了=我会了[doge]

♥ 3

一个黑书包 2025-04-11

坤 2.5 max[doge]

♥ 2

-凯文大帝- 2025-04-28

Van ♂ 2.1 [藏狐]

♥ 1

辣椒炒小鱼__ 2025-04-10

你们两个官方号能不能合并一下

♥ 1 ↩ 2

CG西呱 2025-04-14

感谢万相的开源模型[给心心]

♥ 1

ForAlex 2025-04-12

带因果卷积的3dvae在视频生成领域最早应该是去年opensoraplan开始用的,此后也一直被各家视频生成厂商包括hunyuanvideo等用,WAN2.1主要应该是在此基础上加上缓存流式机制进一步增强一致性

♥ 1

VNKing喔猴 2025-04-10

在哪里可以用

♥ 1 ↩ 1

Moe_FG 2025-04-10

长视频工作流分享一下

♥ 1

AIwood爱屋研究室 2025-04-10

奈斯

♥ 1

-茉莉森- 2025-04-22

qwen2.5的意思是:坤两年半[doge]

伪人AI 2025-04-29

意思是,把分辨率压到全损,然后帧率降到极低,最后用ai补帧和生图在把视频拉回来???[哦呼]

22年还没有复眼正常吗 2025-04-12

一行一行读下去,不要先看结果。 发件人告诉我... 测试后10分钟以内他的愿望就实现了。(所以我翻译成中文,在这里留言,原本是韩文的 *翻译技术很烂*) 大约需要1-2分钟,但感觉是值得的。 试试看吧 首先,准备好纸和笔.. 选择姓名时,请选择你确实认识的人的实名。 请写出凭直觉,瞬间出现在脑海里的答案。 一次阅读一行.. 如果你先看了答案就没什么意思了。 1。首先从上到下(垂直),写出从1到10的数字 2。在数字1和2的旁边各写出一个数字(从1到10之间的一位数) 3。其次在数字3和7的旁边各写出一名异性的名字。 4。在数字4,5,6的旁边各写出一个名字..朋友,家人都可以.... (你不认真回答,等于浪费你自己的时间) 5。 在数字8,9,10的旁边各写出一个歌曲的题目 .. (凭第一感觉) 6。最后,许一个愿望ba... 最近最希望发生的愿望,奇迹什么的... 许了愿望让我们看看这个游戏的结果吧。 首先在数字3旁边的名字,是你爱的人。 在数字7旁写下的是你喜欢,但不能实现的爱情。 在数字4旁边的人是最关心你的人。 在数字5旁边的人是给你带来好运的人。 在数字6旁边的人是对你不利的人。 在数字8写下的歌曲是对数字3写下的人最适合的歌曲。 在数字9写下的歌曲是对数字7写下的人最适合的歌曲。 在数字10写下的歌曲是歌曲是,最适合表达你的想法的歌曲。 最后,你把这片文章转载到其他留言板上,和数字2旁边写下的数字相应的篇数, 你的愿望就会成真33333333