Research questionHow can language agents adapt textual world models to evolving behavior in interactive environments without external rewards?A textual world model trained on earlier behavior can become inaccurate as an agent explores new state-action patterns. In realistic interactive environments, improving the agent is also difficult when external rewards or verifiers are unavailable.