Research questionHow can embodied vision-language navigation follow instructions in unseen environments with limited data and memory?A navigation agent must translate language instructions into actions while moving through unfamiliar environments. Maintaining enough history for each decision can require cognitive maps, accumulated frames, or external 3D tools, while next-action supervision can demand substantial training data.