В статье представлен инновационный подход к диагностике расстройств аутистического спектра (РАС) с использованием передовых архитектур глубокого обучения. Исследователи разработали специализированную модель на базе Vision Transformer (ViT), интегрирующую механизмы контрастивной реконструкции для повышения точности анализа медицинских изображений. Основная методология заключается в обучении модели выделять наиболее значимые паттерны, характерные для аутизма, путем сравнения реконструированных признаков. Использование архитектуры трансформеров позволяет учитывать глобальные пространственные зависимости в данных, что критически важно для нейровизуализации. Данная разработка направлена на автоматизацию скрининга РАС, обеспечивая высокую чувствительность и специфичность при выявлении биомаркеров заболевания. Внедрение подобных интеллектуальных систем в клиническую практику может значительно ускорить постановку диагноза и снизить нагрузку на специалистов.
В статье исследуется проблема систематической ошибки (bias) в моделях компьютерного зрения, оценивающих индекс массы тела (ИМТ) по фотографиям лиц. Такие модели предлагают неинвазивную и недорогую альтернативу физическим измерениям, что полезно для телемедицины, неотложной помощи, автоматического самоконтроля и крупномасштабных эпидемиологических исследований. Однако большинство существующих моделей обучаются на правительственных записях, изображениях из социальных сетей и фотографиях знаменитостей, что приводит к смещению выборки и неспособности представлять широкую общественность. Авторы обучили и оценили модели Vision Transformer (ViT-H/14) на парных данных ИМТ и фотографий лиц из четырех коренных популяций: оранг-асли (Малайзия), джу/'хоанси (Южная Африка), сама (Филиппины) и цимане (Боливия). Были сравнены четыре стратегии обучения: от моделей, обученных на одной популяции (фокальные модели), до моделей, обученных на полном объединенном глобальном наборе данных (глобальные модели). Результаты показали, что обучение на данных целевой популяции всегда дает наилучшую точность. Однако когда целевая популяция отличается от обучающей выборки, добавление большего разнообразия в обучение улучшает предсказания для невидимых популяций. Таким образом, обучение на собственных данных популяции оптимально, если такие данные существуют, а обучение на данных, охватывающих широкий спектр морфологии человека, является лучшей альтернативой в противном случае. Эти выводы подчеркивают важность разнообразия обучающих данных для разработки надежных инструментов машинного обучения в здравоохранении, которые могут обобщаться на разные человеческие популяции.
В исследовании представлен HiCP2GAN — инновационный фреймворк, использующий генеративно-состязательные сети (GAN) для повышения разрешения карт хроматиновых взаимодействий (Hi-C). Основная проблема Hi-C заключается в высокой стоимости получения данных высокого разрешения, что приводит к разреженности карт и затрудняет анализ регуляции генов. Авторы предложили архитектуру «plug-and-play», где в качестве дискриминатора используется предобученная фундаментальная модель на базе Vision Transformer, обученная на колоссальном массиве из 118 миллионов патчей Hi-C различных видов и типов клеток. В отличие от традиционных методов, требующих обучения дискриминатора с нуля, HiCP2GAN использует биологически значимые градиенты от предобученной модели, что обеспечивает стабильность обучения и лучшую обобщающую способность. Методология включает адаптацию энкодера фундаментальной модели в качестве основы дискриминатора с тонкой настройкой (finetuning) только первых слоев при заморозке глубоких слоев трансформера. Эксперименты на линиях клеток человека подтвердили, что HiCP2GAN превосходит стандартные генераторы и классические GAN-модели по качеству восстановления структуры хроматина. Фреймворк является универсальным (generator-agnostic), что позволяет интегрировать его с любыми существующими архитектурами генерации данных Hi-C.
Исследование предлагает новый метод классификации девяти типов поражений кожи с использованием архитектуры Vision Transformer (ViT) для извлечения признаков. Предложенный подход с применением контрастного растяжения и легковесного MLP показал точность обучения 98% и точность тестирования 93,22%.