В статье сравниваются два полууправляемых подхода к классификации опухолевых патчей на гистологических изображениях рака молочной железы: базовый, использующий контролируемую модель для генерации псевдометок, и улучшенный, применяющий состязательное контрастивное обучение (AdCo) на 347 884 неразмеченных патчах. AdCo заменяет фиксированную очередь памяти на обучаемый банк состязательных негативов, что повышает качество представлений. Методы оцениваются на 18 комбинациях архитектур и четырех наборах данных, показывая преимущества состязательного самоконтролируемого предобучения.
В статье представлена модель CIGMA (Causal-inspired Invariant Graph Matching with multi-view contrastive distillation) для прогнозирования ассоциаций между травами и симптомами в традиционной китайской медицине (ТКМ). Авторы решают проблему ограниченности существующих методов, которые не учитывают причинно-следственные связи и страдают от шума в данных. CIGMA использует инвариантное сопоставление графов, вдохновленное причинностью, чтобы выявлять устойчивые закономерности между травами и симптомами, а также многовзглядную контрастивную дистилляцию для улучшения представлений. Модель интегрирует знания из нескольких графовых перспектив (например, структура симптомов, свойства трав) и применяет контрастивное обучение для дистилляции инвариантных признаков. Эксперименты на реальных наборах данных ТКМ показали, что CIGMA превосходит современные базовые методы по точности прогнозирования (например, AUC и F1-score) и демонстрирует лучшую устойчивость к шуму. Работа имеет практическую значимость для персонализированной медицины и открытия новых лекарственных комбинаций, а также предлагает новый взгляд на применение причинного машинного обучения в медицинских графовых задачах.
В статье представлен ContrasTED — новый метод классификации белковых доменов по гомологии, основанный на контрастивном обучении с центроидами, контролируемом классификацией CATH. Метод проецирует структурно-зависимые эмбеддинги в метрическое пространство доменов, что позволяет назначать суперсемейства по ближайшему центроиду. На бенчмарке S20 с фильтрацией по последовательностям (n = 1 028) точность назначения суперсемейств достигла 92,9% для 1-NN и 91,4% для ближайшего центроида, превзойдя поиск по последовательностям, профильные HMM, Foldseek и классификатор на эмбеддингах. Обученное латентное пространство разделяет суперсемейства, сохраняя структурную информацию при идентичности последовательностей ниже 20%, при этом наибольший выигрыш наблюдается для слабо представленных суперсемейств. ContrasTED сгенерировал 4,67 миллиона новых кандидатных назначений для 3 796 суперсемейств в Энциклопедии доменов (TED), расширяя аннотационное покрытие по сравнению с предыдущими структурными методами. Метод решает проблему масштабируемости классификации гомологии в условиях быстро растущих структурных баз данных, обеспечивая высокую точность и вычислительную эффективность.
В исследовании представлен grapHiC — инновационный метод на базе машинного обучения, предназначенный для фазирования гаплотипов при сборке генома de novo без использования родительских данных. Авторы переформулировали задачу фазирования как проблему кластеризации узлов с перекрывающимися кластерами на аугментированных графах унитигов, где узлы представляют фрагменты ДНК, а ребра кодируют перекрытия последовательностей или данные Hi-C близости. В основе метода лежит архитектура Graph Transformer и фреймворк контрастивного обучения с кастомной целевой функцией. grapHiC является первым подходом, способным проводить фазирование необработанных графов унитигов напрямую без предварительного упрощения и без привязки к референсному геному. Эксперименты на масштабе человеческого генома показали, что при интеграции с ассемблером DipGNNome метод обеспечивает непрерывность и качество фазирования, сопоставимое с современными передовыми технологиями (state-of-the-art). Данная разработка значительно упрощает процесс высококачественной сборки сложных геномов, автоматизируя разделение отцовских, материнских и гомозиготных участков.