В журнале npj Digital Medicine опубликовано исследование, посвященное оценке клинических компетенций современных vision-language моделей (VLM) — систем, способных одновременно анализировать изображения и текст. Авторы разработали новый бенчмарк, специально нацеленный на проверку способности моделей к клиническому рассуждению, а не просто к распознаванию паттернов на медицинских изображениях. Результаты показали, что даже самые передовые VLM демонстрируют значительный разрыв между формальной точностью ответов и реальной глубиной клинического мышления: модели часто дают уверенные, но поверхностные или фактически неверные заключения, создавая «иллюзию компетентности». Бенчмарк включает задачи, требующие многошагового анализа, интерпретации результатов визуализации в контексте истории болезни и обоснования дифференциального диагноза. Количественные метрики показали, что лучшие модели достигают лишь около 60-70% точности на простых задачах, но падают ниже 40% на сложных клинических сценариях, требующих интеграции данных. Исследователи подчеркивают, что существующие методы оценки переоценивают возможности ИИ в медицине, и предлагают новый стандарт для валидации систем перед их внедрением в клиническую практику. Работа имеет прямое значение для разработчиков медицинского ПО и регуляторов, подчеркивая необходимость более строгих испытаний на клиническую компетентность, а не только на техническую точность.