从 Sora 看多模态大模型的未来

合集 · 多模态模型 (7)

  1. 46:40
    CogVLM2:第二代视觉大模型,19B即可比肩 GPT-4V
  2. 1:31
    全新GLM-4v-plus,更强的视频理解能力
  3. 3:24
    AI 的「phone use」时刻也来了
  4. 2:33
    GLM-4-Voice:国内首个端到端语音模型
  5. 2:04:49
    从 Sora 看多模态大模型的未来
  6. 1:35
    发布即开源!多模态大模型正在从“看得见”走向“看得懂、想得通”。
  7. 1:25:15
    开源通用视觉语言模型GLM-4.1V-Thinking技术分享
Description
-渐进还是颠覆?从技术、应用、产业等多视角看Sora;
-Sora背后深层问题的共识与非共识;
-Sora对大模型未来走向的影响。

Comments

AI视频小助理 2024-03-04

一、本次分享活动主题为SORA大模型,邀请了两位一线专家进行讲解,其中丁宁主要介绍了质朴在多模态方向上的工作,卡兹克则分享了他在AI视频领域的创作。 00:01 - 介绍z builder系列分享活动第三期 00:39 - 介绍SORA开放式纹身视频大模型 03:05 - 介绍嘉宾卡兹克,一个偏向视频制作的AI视频专家 二、关于SORA的一些技术和效果,以及作者的一些观点和预测。视频分辨率和生成时间等方面的突破,以及可能的算法创新。 08:21 - 介绍自己是副院长,参与大模型相关事情 09:00 - 第一次看到SORA时,对效果感到惊艳,但也有关注过类似的纹身视频进展 12:21 - SORA能生成60秒的视频,对架构和算力带来挑战,需要更强的压缩和细节技术 三、AI视频技术的痛点和改进,以及商业化交付的可行性。同时,通过一个案例展示了AI视频技术在电影和预告片中的应用。 16:42 - 应用层的包装应用让我们接触到最前沿的技术 17:35 - AI视频工具的痛点:时长、一致性、物理规律 22:08 - AI视频无法做到商业化交付,需要解决物理规律问题 四、作者的工作流和思维,以及对于AI视频制作的一些挑战和问题。作者还讨论了SA和SORA等技术的使用和区别。 25:01 - 作者介绍自己的工作流和视频制作过程 26:10 - 作者讲述使用AI视频制作时的挑战和突破 32:01 - 作者认为AI视频制作需要更多的研究和开发,需要考虑使用者和研究者之间的脱节 五、最近在图像处理领域出现的技术突破,以及其在实际工作中的应用和价值。此外,视频还探讨了研究者和产品经理的角色和能力。 33:21 - 抠图技术在工作中非常有用 34:24 - 科研人员需要关注有用性和难度挑战性 37:44 - SORA的技术突破是提高训练效率,以便学习更多的视频内容 六、对于视频理解模型的研究和讨论,包括模型的训练和应用。同时,还讨论了物理规律在模型中的体现和掌握程度。 41:40 - 学术界对这个事情的追随存在挑战,需要足够的资源量 42:57 - 谷歌可能会更快地实现这个模型,但其他公司需 --本内容由AI视频小助理生成,关注解锁AI助理,由@Seezzy 召唤发送

♥ 5

奇怪的ID增加了 2024-03-20

总结就是sora不是世界模拟器,只是世界渲染器

♥ 1

复仇之人cengge 2024-03-18

你们的大语言模型的屏蔽词有点离谱了。 生成到一半,直接不生成了。

♥ 1 ↩ 3

冷冷的竖琴 2024-03-12

您好,麻烦解决一下这个bug(每次从语音通话模式退出后都会这样)

♥ 1

-瑟瑟发抖- 2024-05-07

你们为什么不开源

流式输出 2024-03-08

并未发布是吧[doge]

Seezzy 2024-03-04

@AI视频小助理 总结一下