本文系统分析了视觉–语言–动作(vision-language-action, VLA)模型的相关技术,介绍了该技术的诞生、发展、挑战,以及未来技术突破的方向。
[具身智能, 视觉语言模型, 大语言模型, 机器人, 生成式人工智能, 空间感知, 场景探索]
[王寄哲, 张伟男, 刘挺]