清华花佳诚:结构化文本表征引导多模态大模型空间推理
合集 · ACL 2026 (12)
-
北大张文涛:面向大模型的 Data-centric AI 基础设施
35:08
-
北师大钟方威:基于欲求对齐的高效具身通信与主动交互
20:56
-
清华陈泽华:全局语义、精确时间、人声可懂的高可控文生音频系统ControlAudio
12:14
-
UCLA周自横:用 LLM Agent 模拟研究人类为何进化出道德
14:01
-
人大汤昕宇:可验证奖励的强化学习中样本极性的探索
15:13
-
MBZUAI高朗:个性化场景下AI文本检测器的效果反转现象
19:28
-
中科院李阳:面向细粒度AI生成文本检测的“创作者-编辑者”双重建模
16:22
-
西湖大学张驰 | 自主进化智能体:从固定工作流到动态架构的演进
39:51
-
圆桌对话:Agent又有了新范式?
56:58
-
北理工田炎智:基于Agent-as-a-Judge的非字面翻译评测
12:37
-
清华花佳诚:结构化文本表征引导多模态大模型空间推理
14:09
-
北理工杨振:大模型视角旋转理解可解释性研究
13:43
Description
本文介绍了一种名为 TRACE 的提示方法,旨在提升多模态大语言模型(MLLMs)在视频中的 3D 空间推理能力。现有 MLLMs 难以从自我中心视频中构建结构化的三维环境抽象,因而在空间问答任务中表现受限。TRACE 借鉴以环境为中心的空间认知理论,引导模型生成基于文本的三维环境表示作为中间推理轨迹,内容包括元上下文、相机运动轨迹和详细物体实体信息。实验结果表明,TRACE 在 VSI-Bench 和 OST-Bench 上相较既有提示策略取得了稳定且显著的提升,并适用于不同规模和训练方式的多种 MLLM。消融实验和进一步分析也验证了该方法设计的有效性,并揭示了 MLLMs 进行 3D 空间推理时的关键瓶颈。