首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >ACM MM 2026 | SIS-Bench:无人机具身空间智能的自我认知能力评估基准与增强方法

ACM MM 2026 | SIS-Bench:无人机具身空间智能的自我认知能力评估基准与增强方法

作者头像
Amusi
发布2026-07-28 16:58:02
发布2026-07-28 16:58:02
550
举报
文章被收录于专栏:CVerCVer

转载自:视觉语言导航

✨导读:现有无人机多模态大模型只看懂环境、分不清自身运动状态,本文打造SIS-Bench统一评测基准,从「空间认知+自我觉知」双维度分层评估26款主流模型;进一步提出SIS-Motion光流运动融合方案,证明建模无人机自身运动可同步提升环境理解与自我推理,为低空具身智能提供标准化评测与优化思路。

  • 作者:Zhishan Zou, Guoyan Sun, Zhiwei Wei, Jiancheng Pan, Yujie Li, Mugen Peng, Wenjia Xu†
  • 单位:北京邮电大学,湖南师范大学,清华大学
  • 标题: Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence
  • 会议: ACM International Conference on Multimedia (ACM MM 2026)
  • 论文: https://arxiv.org/abs/2607.12477
  • 主页: https://choucisan.github.io/publications/self-in-space/
  • 代码: https://github.com/IntelliSensing/Self-in-Space
  • Hugging Face: https://huggingface.co/collections/choucsan/self-in-space
  • ModelScope: https://www.modelscope.cn/collections/choucisan/Self-in-Space

大模型已经能够识别车辆、理解地标,甚至根据视觉信息给出导航路线。但当它被部署在一架持续运动的无人机上,问题便不再只是“画面中有什么”:模型还需要判断自己正在上升、转向还是向前飞行,并理解自身运动如何改变眼前的空间

这暴露出现有无人机智能评测中的一处缺口。多数基准围绕外部场景理解或任务完成展开,却较少显式考察智能体能否持续理解“自己正在做什么”。对于具身系统而言,外部空间与自身状态并非彼此独立;真正的空间智能既要理解环境,也要理解处于环境中的“自我”。

围绕这一问题,研究团队提出 SIS-Bench(Self-in-Space Benchmark),在统一框架下评估多模态大模型的空间认知与自我认知能力。基准进一步将两类能力组织为感知、记忆和推理三个认知层级,从而系统分析模型对外部空间、UAV 自身状态及二者交互关系的理解能力。

总体框架

SIS-Bench:统一的 Self-in-Space 评测基准

SIS-Bench 包含两个互补维度。空间认知(spatial cognition) 关注物体、地标、相对位置以及场景一致性;自我认知(self-awareness) 关注无人机自身的动作、运动历史和未来行为。两个维度均按照感知、记忆和推理组织,共形成 13 项任务。

感知层主要评估单段视频中的直接识别能力,包括目标存在、目标属性、相对方向和动作识别。记忆层使用拼接视频,评估地标顺序、地标回忆、位置关系、动作序列和动作回忆。推理层则基于长视频和乱序视频,考察空间一致性、时空一致性、动作预测和路径规划。

基准任务

基准最终包含 1,646 段真实 UAV 视频、14.9 小时视频素材和 4,856 个多项选择问答对,覆盖城市、居住区、工业区域和自然环境等多类场景。

基准构建流程

多模态大模型评估结果

研究团队在 SIS-Bench 上对多种具有视频理解能力的代表性多模态大模型进行了系统评估,从空间认知、自我认知以及不同认知层级三个方面分析当前模型的能力边界。

SIS-Bench 模型评测结果

第一,空间认知与自我认知之间存在明显不平衡。 以整体准确率最高的 Gemini-3-Flash 为例,其空间认知平均准确率为 83.7% ,自我认知平均准确率为 58.6% ,相差 25.1 个百分点。这表明当前模型更擅长理解物体、地标和场景关系,而在无人机自身动作、运动历史和细粒度自运动判断方面仍存在明显不足。

第二,模型性能随着认知要求提高而持续下降。 整体表现呈现出感知优于记忆、记忆优于推理的层级规律,说明当前模型能够较好地完成直接视觉识别,但在跨时间信息保持和高层推理方面仍面临困难。统一采用 32 帧采样、重复随机乱序以及 Chain-of-Thought 和 Tree-of-Thought 提示等控制实验均未改变这一趋势,表明结果并非由单一采样方式或视频构造造成。

第三,当前模型与人类表现仍有较大差距。 类评测的平均准确率为 91.7% ,而表现最好的模型整体准确率为 71.6% ,二者相差超过 20 个百分点。这说明 SIS-Bench 尚未饱和,无人机具身空间理解仍具有较大的研究空间。

SIS-Motion:面向无人机自运动理解的运动感知探索

基于 SIS-Bench 揭示的运动理解瓶颈,研究团队进一步开展 SIS-Motion 探索,考察显式运动信息能否改善 self-in-space 建模。作为一项受控实验,SIS-Motion 主要用于分析运动线索对空间认知和自我认知的实际作用,而非追求复杂的架构设计。

在模型设计上,SIS-Motion 采用视觉与运动双分支结构。视觉编码器负责提取场景外观、物体布局和环境语义;运动编码器则基于相邻视频帧的光流信息,表征运动方向、动作变化和视角演化。两类特征经过时间与维度对齐后,由轻量连接器完成融合,并共同输入语言模型进行预测。

SIS-Motion

为支持该实验,团队从 AirScape 训练集构建与 SIS-Bench 严格分离的 SIS-Motion-54K。数据包含选择题、开放问答和描述三种形式,主要监督 9 项感知与记忆任务。

关键结果如下

研究团队分别在 Qwen2.5-VL-3B 和 Qwen2.5-VL-7B 骨干上开展受控对比。在每种骨干规模下,视觉 SFT 基线与 SIS-Motion 使用相同的训练数据和基本训练设置,以考察加入运动特征后的性能变化。

在 3B 设置下,SIS-Motion 的整体准确率由 66.4% 提升至 69.1% ,空间认知平均准确率由 72.0% 提升至 74.2% ,自我认知平均准确率由 60.3% 提升至 63.7% 。在相同训练条件下的 7B 对比中,整体准确率由视觉 SFT 的 73.1% 提升至 76.9% ,提高 3.8 个百分点。两种骨干规模下的整体准确率均有提升,表明显式运动信息能够在受控条件下改善 self-in-space 建模。

研究还在基于 OpenUAV 构建的下游导航测试中考察迁移能力。该测试包含 22 个模拟环境和 3,895 个问题,所有模型均以零样本方式评估。SIS-Motion 的准确率为 92.2% ,高于原始 Qwen2.5-VL-3B 模型的 71.2% ,表明运动感知训练获得的能力可以迁移到 SIS-Bench 之外的无人机导航场景。

下游导航任务

局限性与适用边界

这项工作仍有明确的适用边界。SIS-Bench 的主要贡献是将空间与自我统一组织在感知、记忆和推理框架中,而不是提出全新的原子任务。其数据仍来自有限的既有来源,评测形式以选择题和开环视频理解为主,因此还不能直接代表真实无人机在开放环境中的闭环能力。

SIS-Motion 同样是一项受控探索,而非高度优化的新架构。它的提升主要集中在感知和记忆层,推理任务上的收益有限且不稳定。相较视觉 SFT,Action Prediction 从 45.2% 降至 44.1% ;Path Planning 虽从 20.6% 升至 23.5% ,仍低于 25.2% 的随机基线。SIS-Motion-54K 不包含规划任务的训练样本,局部光流信息也不足以支撑目标驱动的长程决策。

从基准评测走向真实飞行

因此,论文目前回答的主要是两个问题:如何系统测量 UAV 模型对空间与自身状态的联合理解,以及显式运动线索能否缓解其中一部分短板。它尚未覆盖完整的感知、推理与行动闭环。

后续工作仍需要扩大数据来源与模型范围,并进一步融合运动、深度、几何和长时序信息。在此基础上,self-in-space 能力还需要进入真实导航、规划、交互和连续控制任务,才能验证它能否转化为稳定的自主飞行能力。

本文系学术转载,如有侵权,请联系CVer小助手删文

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-27,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 CVer 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • SIS-Bench:统一的 Self-in-Space 评测基准
  • 多模态大模型评估结果
  • SIS-Motion:面向无人机自运动理解的运动感知探索
  • 局限性与适用边界
  • 从基准评测走向真实飞行
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档