学术研究★★★arXiv · 2026-07-16
SceneBind:跨视觉、音频和语言的场景绑定SceneBind 提出了一种多模态表示方法,结合了视觉、音频和语言的语义与3D空间理解,弥补了现有方法在空间结构上的不足。
- SceneBind 将每个场景表示为语义-空间实体,结合全局语义嵌入和以对象为中心的语义-空间槽位
- 该表示方法明确捕捉了对象级别的语义、空间属性及不确定性
- SceneBind 补足了现有多模态编码器在实例级语义之外的空间结构缺失
SceneBind 提出了一种多模态表示方法,结合了视觉、音频和语言的语义与3D空间理解,弥补了现有方法在空间结构上的不足。