Research questionHow can text-to-image models preserve variation in unspecified visual factors under long, semantically dense prompts?As prompts accumulate semantic constraints, generated images can converge on similar outputs even when some visual attributes remain unspecified. This makes it difficult to distinguish faithful conditioning from unwanted suppression of legitimate visual variation.