25年12月来自南京科技大学计算机科学和工程系、人大、新加坡国立和新加坡管理大学的论文(CVPR’26)“HISTORY TO FUTURE: Evolving Agent with Experience and Thought for Zero-shot Vision-and-Language“。
连续环境条件下智体根据语言指令,导航至目标地点,即VLN- CE。随着大语言模型(LLM)的发展,近期研究开始探索将其应用于零样本(zero-shot)VLN-CE 任务,这为解决传统基于训练的范式中泛化能力差的问题提供了一种有前景的方案。然而,现有的基于 LLM 的方法在决策时主要进行简单的推理,且缺乏反馈机制(例如回顾历史错误或预测未来可能情况),导致智体在初次出错的任务上可能陷入持续失败的困境。
本文重新审视基于 LLM 的零样本 VLN-CE,并提出一种名为 EvoNav 的新范式;该范式通过“未来思维链”(Future Chain-of-Thought, F-CoT)和“历史经验链”(History Chain-of-Experience, H-CoE),利用对未来的预判和历史经验来优化智体的决策过程。其中,F-CoT 将预测的未来动作和地标转化为思维内容,辅助评估导航进度并指导方向选择;H-CoE 则将历史轨迹与场景信息总结为经验,从而提升导航决策的可靠性。F-CoT 与 H-CoE 协同作用,共同推动智体决策能力的演进。
如图 1 所示:以往针对基于训练范式的 VLN-CE任务的方法,往往在未见场景中面临零样本泛化能力差的问题。近期研究利用大语言模型(LLM)丰富的世界知识来应对这一挑战,并探索将其应用于零样本 VLN-CE,但这些方法往往采用缺乏反馈机制的简单推理方式(例如未能有效回顾历史错误或预测未来可能情况),从而导致决策效果不佳。本文提出通过“历史经验链”(H-CoE)和“未来思维链”(F-CoT)引入基于历史经验与未来构想的反馈推理机制,以此提升基于 LLM 智体的决策能力。

如图2 所示EvoNav 的总体框架。EvoNav 采用两种互补的推理机制来解决零样本 VLN-CE(基于连续环境的视觉-语言导航)任务:即“未来思维链”(F-CoT)和“历史经验链”(H-CoE)。在输入全景 RGB 图像和深度图像后,标准的路径点预测器 [20] 首先识别出候选的路径点图像。随后,F-CoT 对这些图像进行分析,预测下一步的动作及地标(作为“思维”),从而指导当前的导航进程与方向。紧接着,H-CoE 从动态经验库中检索与轨迹及场景相关的经验;该经验库持续汇总并存储已完成的导航轨迹及曾访问过的场景信息。最后,检索的历史经验与未来思维在动作预测模块中进行融合,以支持决策制定。

F-CoT 旨在通过指令提取、未来动作预测、进度估计和未来地标预测这四个主要阶段,利用对未来的预判来辅助导航进度估计与方向选择。
其提出一种“历史经验链”(History-of-Experience, H-CoE)推理方法。该方法在线汇总历史导航任务中的文本轨迹与视觉图像并将其转化为经验,旨在利用这些经验优化面对相似指令或场景时的当前决策过程。这一过程通过两种互补的历史经验——即文本轨迹经验与视觉场景经验——来实现。
智体的动作预测,通过历史经验和未来构想,得到优化,具体包括:
• 视图观测:简要描述视野内的可见物体及其空间关系。
• 构想辅助:利用未来路标 Lf 辅助当前移动方向的预测。
• 经验辅助:检索当前回合相关的轨迹经验 Et_n 和场景经验 Ev。
• 视点选择:基于上述信息,选择最合适的视点进行移动。



