清华花佳诚:结构化文本表征引导多模态大模型空间推理

合集 · ACL 2026 (12)

  1. 35:08
    北大张文涛:面向大模型的 Data-centric AI 基础设施
  2. 20:56
    北师大钟方威:基于欲求对齐的高效具身通信与主动交互
  3. 12:14
    清华陈泽华:全局语义、精确时间、人声可懂的高可控文生音频系统ControlAudio
  4. 14:01
    UCLA周自横:用 LLM Agent 模拟研究人类为何进化出道德
  5. 15:13
    人大汤昕宇:可验证奖励的强化学习中样本极性的探索
  6. 19:28
    MBZUAI高朗:个性化场景下AI文本检测器的效果反转现象
  7. 16:22
    中科院李阳:面向细粒度AI生成文本检测的“创作者-编辑者”双重建模
  8. 39:51
    西湖大学张驰 | 自主进化智能体:从固定工作流到动态架构的演进
  9. 56:58
    圆桌对话:Agent又有了新范式?
  10. 12:37
    北理工田炎智:基于Agent-as-a-Judge的非字面翻译评测
  11. 14:09
    清华花佳诚:结构化文本表征引导多模态大模型空间推理
  12. 13:43
    北理工杨振:大模型视角旋转理解可解释性研究
Description
本文介绍了一种名为 TRACE 的提示方法,旨在提升多模态大语言模型(MLLMs)在视频中的 3D 空间推理能力。现有 MLLMs 难以从自我中心视频中构建结构化的三维环境抽象,因而在空间问答任务中表现受限。TRACE 借鉴以环境为中心的空间认知理论,引导模型生成基于文本的三维环境表示作为中间推理轨迹,内容包括元上下文、相机运动轨迹和详细物体实体信息。实验结果表明,TRACE 在 VSI-Bench 和 OST-Bench 上相较既有提示策略取得了稳定且显著的提升,并适用于不同规模和训练方式的多种 MLLM。消融实验和进一步分析也验证了该方法设计的有效性,并揭示了 MLLMs 进行 3D 空间推理时的关键瓶颈。