В исследовании представлена инновационная мультимодальная модель (vision-language model), которая имитирует когнитивный процесс врача-радиолога при анализе медицинских изображений. Ключевой особенностью разработки является использование данных о движении глаз (eye-tracking) и вербальных рассуждениях экспертов в процессе обучения. Это позволяет модели не просто классифицировать патологии, но и фокусироваться на критически важных анатомических зонах, имитируя человеческое внимание. Методология обучения объединяет визуальные признаки рентгенологических снимков с текстовыми объяснениями, что повышает точность интерпретации сложных случаев. Результаты демонстрируют значительное превосходство модели над стандартными архитектурами в задачах описания изображений и постановки диагнозов. Данная технология открывает путь к созданию более прозрачных и объяснимых систем поддержки принятия врачебных решений (CDSS) в радиологии. Практическая значимость работы заключается в сокращении времени на анализ снимков и снижении вероятности пропуска патологий из-за человеческого фактора.