理解画面捕捉细节,你的AI音效师来啦!

合集 · 通义前哨站 (71)

  1. 1:02:05
    【直播回放】ICLR 2025论文解读(上)——通义实验室篇
  2. 1:11
    智能体工作流评估新框架:WorFBench
  3. 1:20
    这是通义千问的来时路。
  4. 15:23
    从单图到可驱动3D数字人生成技术讲解
  5. 1:15
    有人问Qwen2.5-Omni 和VL的区别?
  6. 1:27:46
    【直播回放】ICLR 2025论文解读(下)——通义实验室篇
  7. 2:03
    通义万相2.1的3D VAE是什么?
  8. 1:29
    多模态大模型解题新思路:mPLUG-Owl3
  9. 0:42
    行业首发全栈MCP服务,尽在百炼平台~
  10. 1:29
    通义万相2.1首尾帧生视频模型开源
  11. 1:23
    【玩转MCP】手把手教你自定义部署MCP服务
  12. 1:23
    【玩转MCP】手把手教你搭建专属MCP Agent
  13. 1:57
    超写实3D数字人大模型(LAM)技术报告解读
  14. 1:34
    表情、声音、说话风格一键复刻!
  15. 0:23
    我们为千行百业而来。
  16. 0:40
    Qwen3 来了!
  17. 1:20
    Thinking Budget:让大模型灵活思考
  18. 0:56
    Qwen3+MCP带来哪些新场景?
  19. 1:00
    太好了,是Qwen的Deep Research,我们有救了
  20. 1:07
    通义万相视频编辑统一模型VACE开源发布
  21. 10:01
    【直播回放】通义万相视频编辑统一模型VACE开源
  22. 2:14
    如果有Wan Day,它会是什么样子?
  23. 2:42
    ZeroSearch:无需真实搜索也能激发模型搜索能力
  24. 3:24
    今天来复习一下Qwen2.5-VL技术报告!
  25. 3:15
    ParScale:一种全新的大模型Scaling Law
  26. 2:01
    大模型如何持续进化,实现精准检索?
  27. 59:14
    【直播回放】Qwen3-Embedding模型深度解析
  28. 2:40
    语音识别怕噪声?CoGenAV 来破局!
  29. 0:37
    在这里,了解通义千问的一切
  30. 1:36
    微表情捕捉、潜台词翻译,AI“读心专家”就位!
  31. 1:47
    理解画面捕捉细节,你的AI音效师来啦!
  32. 5:03
    框架开源,无需邀约,即刻体验!
  33. 0:57
    Qwen Vlo|描绘你关于世界的想象
  34. 1:51
    10分钟,打造你的专属实时语音交互应用!
  35. 1:41
    手机也能跑 Qwen3?手把手教你部署!
  36. 1:10
    一句话玩转网页开发!
  37. 1:04:15
    【直播回放】Ask Qwen3 Anything 2025年04月30日10点场
  38. 52:16
    如何让AI有理有据地识别情绪?
  39. 5:10
    来吧,上船,起航!
  40. 1:16
    👂听说,Qwen3-Coder其实也能听懂大白话?
  41. 1:57
    人人都是大导演!通义万相2.2来了!🤩
  42. 1:05
    Github 5K+🌟WebAgent研究团队新作:WebShaper来啦
  43. 1:57
    书画双全!Qwen-Image开源🖌
  44. 2:04:47
    【直播回放】Qwen-Image技术报告解读和模型实战攻略01
  45. 1:05
    音画传情 声启万相
  46. 3:39
    什么呀?语音识别现在也要调监控啦🧐?
  47. 4:03
    AgentScope1.0:终结智能体黑盒🗃️,打造生产级可控应用
  48. 1:41
    🎙️ 开麦即真:CosyVoice 全面升级
  49. 1:20
    不止入戏,更能入景🎬
  50. 2:35
    说得更好、更准、更自然:Qwen3-TTS上线
  51. 6:55
    原生全模态不降智
  52. 2:03
    Qwen3-VL 看懂、理解并响应世界
  53. 0:58
    多图编辑进化,万物皆可一键“同框”!
  54. 0:41
    大就是好!Qwen3-Max 正式亮相
  55. 0:41
    通义万相2.5:一句指令,玩转图像魔法
  56. 0:44
    别让声音困住你的效率
  57. 0:47
    通义万相2.5:一句话实现“Vibe PSing”!
  58. 0:48
    通义万相2.5:让声音当你的视频“导演”!
  59. 1:21
    通义万相2.5:让画面“声”动起来!
  60. 0:54
    通义万相2.5:能听懂,也能准确执行!
  61. 4:52
    Qwen3-Omni API上新:声形意合,令出智随
  62. 1:15
    Fun-CosyVoice 3 重磅升级|更快、更准、更强表达力
  63. 1:21
    Fun-ASR 全新升级|企业级抗干扰
  64. 0:39
    「通义万相2.6」来啦!所有角色,听我指挥
  65. 0:51
    Qwen-Image-Layered:下一代图像生成基础模型 🚀
  66. 0:55
    进来复习!是谁8步推理1秒出图
  67. 1:39
    【能干活的高情商语音搭子】
  68. 3:19
    Qwen3-TTS上新,支持跨物种克隆音色!
  69. 0:57
    Qwen-Image-2512 正式开源发布!
  70. 1:16
    除夕!Qwen3.5来了!
  71. 2:53
    Qwen-Audio-3.0-Realtime 发布:懂倾听,更聪明的实时语音方案
Description
🔥 通义实验室开源旗下首个音频生成模型ThinkSound,该模型首次把多模态大模型的思维链推理引入音频生成领域,让AI可以像专业音效师一样逐步思考,捕捉视觉细节,生成与画面同步的高保真音频。目前,ThinkSound的代码和模型已在Github、HuggingFace、魔搭社区开源,开发者可免费下载和体验。

🤔 思维链推理让ThinkSound可以模仿人类音效师的多阶段创作流程,实现对视觉事件与相应声音之间深度关联的精准建模,例如先分析视觉动态、再推断声学属性,最后按照时间顺序合成与环境相符的音效。不仅如此,我们还构建了首个带思维链标注的音频数据集AudioCoT,该数据集融合了2531.8小时的多源异构数据,让模型在音频生成与编辑任务时做到“知其然、知其所以然”。

🚀 在开源的VGGSound测试集上,ThinkSound的核心指标相比MMAudio、V2A-Mappe、V-AURA等现有主流方法均实现了15%以上的提升。例如,在openl3空间中Fréchet 距离(FD)上,ThinkSound 相比 MMAudio的43.26 降至34.56(越低越好),接近真实音频分布的相似度提高了20%以上;在代表模型对声音事件类别和特征判别精准度的KLPaSST 和 KLPaNNs两项指标上分别取得了1.52和1.32的成绩,均为同类模型最佳。

Comments

SoraDreamWorks 2025-07-04

阿里中国开源扛把子的位置不可动摇!

♥ 346 ↩ 25

QWQ爆炸豆 2025-07-04

[思考]试了一下在线的demo不知道为啥生成结果老是会出现诡异的音乐像鬼片一样

♥ 107 ↩ 3

vorale2 2025-07-04

阿里的每个开源模型都能关联到一些不可描述的场景上[星星眼]

♥ 77 ↩ 6

迪士尼·中国 2025-07-04

那如果我让它生成画面是猫,声音是猪的音频呢?能生成吗?[doge]

♥ 42 ↩ 1

lewislee01 2025-07-24

硬件算力解决了之后,阿里没准真能和微软谷歌硬碰硬[星星眼]

♥ 31 ↩ 1

枫林595073746 2025-07-16

我天,这个要是发展成熟了,对于做影视或者游戏音效就太方便了。以前要么拟音要么在素材库里翻合适的,这个直接根据当前情况生成,真逆天。

♥ 22 ↩ 1

CBYellowstone 2025-07-04

有审查吗[doge]

♥ 21 ↩ 13

辣个放荡不羁的男人 2025-07-17

你们能不能把开发者文档写好一点,最近用esp32s3做东西你们的文档我是真燃尽了[笑哭]

♥ 18 ↩ 7

逐风CHASER 2025-07-20

我 需 要 你 们 更 新 ”通义千问” App,现在我都转向国际网页版了[doge]

♥ 16 ↩ 4

foreverSR 2025-07-05

我什么都不说你也懂了[doge]

♥ 11 ↩ 2

账号已注销 2025-07-04

不闭源吗

♥ 7 ↩ 4

Mux_l 2025-07-28

能本地部署吗 生成后的音频能拿来做一些用吗

♥ 5 ↩ 4

Rl-studio官方音乐 2025-07-18

我!曾经!有!份!工!作![笑哭]

♥ 5

今时往惜 2025-07-18

按照这样发展,以后的影视相关产品是不是都可以量产了,再加上ai,想都不敢想,以后的人怕是吃不到细糠了

♥ 3

__-空空-__ 2025-07-17

我在想 这些工具会不会被坏人拿来用作制作有利于自己的伪证

♥ 3

Earthquakes地震 2025-07-04

太厉害了!🎉

♥ 3

oneds6 2025-07-04

关键是有1030卡带训练功能啊,目前是具身时代了[doge_金箍][doge_金箍][doge_金箍]

♥ 2

SteveO2 2025-07-11

可以帮我把合唱的两个人声音分开吗?[大哭]

♥ 2 ↩ 4

咸蛋酱巴拉巴 2025-08-30

源神

♥ 1

烧壶玉冰烧 2025-08-12

开源跟消费token,两回事吧

♥ 1