学术研究★★★arXiv · 2026-07-16
SceneBind:跨视觉、音频和语言的场景绑定SceneBind 提出了一种多模态表示方法,结合了视觉、音频和语言的语义与3D空间理解,弥补了现有方法在空间结构上的不足。
- SceneBind 将每个场景表示为语义-空间实体,结合全局语义嵌入和以对象为中心的语义-空间槽位
- 该表示方法明确捕捉了对象级别的语义、空间属性及不确定性
- SceneBind 补足了现有多模态编码器在实例级语义之外的空间结构缺失
SceneBind 提出了一种多模态表示方法,结合了视觉、音频和语言的语义与3D空间理解,弥补了现有方法在空间结构上的不足。
FFmpeg 9.1 版本中新增了一个 AAC 编码器,提高了音频压缩效率。该编码器支持多种音频格式,包括 AAC-LC、HE-AAC 和 HE-AACv2。