RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时扩展
尽管视觉-语言-动作(VLA)模型展现出令人印象深刻的视觉运动能力,但其在困难和分布外任务上的性能往往会下降。现有测试时引导和缩放方法虽能无需大量数据收集和重训练即提升性能,但动作样本仍集中于相似行为,继承了相关的失败模式。此外,现有方法在每个时间步都采用相同的干预策略,未考虑基础策略是否可能已成功。为解决这些局限,研究者提出了RL^2-VLA。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。