Research questionHow can vision-language models standardize raw, heterogeneous clinical data before medical inference?Clinical data often arrives across varied image formats, text sources, annotation formats, and directory layouts rather than as ready-made image-text inputs. Identifying, converting, extracting, and correctly pairing these fragments is a prerequisite for downstream medical inference.