Research questionHow can visual speech recognition resolve ambiguous words without committing before enough context is available?Visual speech recognition must transcribe speech when similar lip movements make multiple words plausible. Left-to-right decoding can commit to an early interpretation before later visual context disambiguates it.