ReferTrack:用于具身视觉追踪的指代-追踪框架
具身视觉追踪(EVT)要求移动智能体仅通过机载视觉持续跟随自然语言描述的目标。ReferTrack 提出一种指代-追踪范式,使用单个前向摄像头实现具身追踪,先从图像中选取目标。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
具身视觉追踪(EVT)要求移动智能体仅通过机载视觉持续跟随自然语言描述的目标。ReferTrack 提出一种指代-追踪范式,使用单个前向摄像头实现具身追踪,先从图像中选取目标。
查看原文