В статье представлен конвейер SuperLearner на основе мультиомических данных для 33 типов рака, который моделирует индивидуальные топологии выживаемости, связанные с регулируемой клеточной гибелью (RCD). Используя ансамбль методов машинного обучения (Random Survival Forests, XGBoost, Survival-Boruta, Multi-Task Logistic Regression) и мета-обучатель, авторы достигли медианного C-индекса 0.749 и подтвердили обобщаемость на внешних данных CPTAC. Разработанный инструмент CancerRCDPredictor интегрирует LLM для персонализированной онкологии.
В статье представлен multiTEMPTED — новый метод машинного обучения для совместного анализа продольных мультиомных данных, который расширяет существующий фреймворк тензорного разложения на несколько (M≥1) омиксных модальностей одновременно. Метод оценивает общие для всех модальностей компоненты субъектов, специфичные для модальностей нагрузки признаков и временные траектории, при этом допускает произвольные, несогласованные графики выборки без импутации пропусков. В когорте беременных MOMS-PI совместный анализ вагинального микробиома и цитокинов цервиковагинальной жидкости позволил получить более четкое разделение исходов преждевременных и срочных родов по сравнению с анализом только микробиома, выявил защитную роль сообществ, доминируемых лактобациллами, и показал расходящиеся траектории цитокинов у женщин с последующими преждевременными родами. В исследовании физических упражнений с четырьмя плазменными омиксными модальностями ведущий unsupervised компонент от multiTEMPTED был сильно связан с полом, тогда как компоненты от MEFISTO не показали связи с известными фенотипами и выглядели численно вырожденными. В симуляционных экспериментах multiTEMPTED точно восстанавливает структуру компонентов при различных уровнях шума, превосходит MEFISTO в ряде настроек и работает на несколько порядков быстрее. Метод реализован в открытом R-пакете multi.tempted (https://github.com/loulind/multi.tempted).
Исследователи представили Ageas — вычислительную платформу на основе трансферного обучения, которая позволяет определять судьбу клеток (их будущую дифференцировку) по статическим молекулярным данным, не требуя временных измерений или генетического маркирования. Метод обучается на терминальных клеточных популяциях, извлекая «память судьбы», и переносит эту информацию на клетки-предшественники, что даёт возможность предсказывать их потенциал развития. Ageas использует адаптивную ансамблевую стратегию с автоматическим выбором моделей, что обеспечивает устойчивую работу с разными типами омиксных данных — транскриптомикой, эпигеномикой и пространственной транскриптомикой. В тестах на эталонных наборах данных с прослеженными линиями клеток Ageas показал более высокую точность по сравнению с существующими методами. Применение к 3D-модели человеческого эмбриона выявило пространственно организованный передне-задний градиент предрасположенности эпибласта: передние клетки склонны к эктодермальной судьбе, задние — к линиям, происходящим из первичной полоски, с соответствующими региональными регуляторными программами. Работа устанавливает Ageas как универсальный инструмент для расшифровки решений о судьбе клеток из статических молекулярных снимков, что важно для биологии развития и исследований заболеваний, включая онкологию.
Исследование представляет MetaClaw — инновационный агентный фреймворк на базе больших языковых моделей (LLM), предназначенный для автоматизации сложных биоинформатических рабочих процессов. В отличие от существующих решений, MetaClaw обеспечивает полную воспроизводимость и аудируемость за счет разделения анализа на детерминированный поток FlowHub и настраиваемые контейнеры OpenClaw, объединенные единым реестром YAML-конвейеров. В ходе тестирования на 94 образцах из четырех опубликованных исследований система продемонстрировала высокую точность: восстановление 3/3 признаков рассеянного склероза (RRMS), 5/5 групп маркеров вечной мерзлоты и 3/5 маркеров колоректального рака (CRC). Бенчмаркинг показал, что использование целостной архитектуры реестра сокращает время выполнения задач на 32%, уменьшает количество вызовов инструментов на 37% и снижает затраты на токены на 47%. Система гарантирует безопасность данных, так как контейнеры для последующего анализа работают без доступа к сети. MetaClaw успешно решает проблему воспроизводимости выводов в мультиомных исследованиях, обеспечивая устойчивость к возмущениям и измеримую эффективность ресурсов.
Представлена GatorPrism — инновационная архитектура на основе смеси экспертов (Mixture-of-Experts), использующая самообучение и коалиционные графы для интеграции пространственных мультиомиксных данных. Методология системы позволяет разделять общий консенсус между различными омиксными слоями и специфические сигналы каждой модальности, адаптируя их вклад в зависимости от конкретной локации в ткани. В рамках модели совместный эксперт кодирует консенсусный граф на основе пересечений, а частные эксперты фиксируют уникальные пространственно-молекулярные структуры, при этом маршрутизатор на основе прототипов назначает веса для каждой точки ткани. В ходе тестирования на восьми наборах данных GatorPrism продемонстрировала превосходство над девятью конкурирующими методами по девяти метрикам кластеризации. Исследование на тканях миндалевидного железа человека подтвердило точность выделения доменов через соответствие маркерам RNA и ADT, а анализ эмбрионального мозга мыши выявил анатомически локализованные состояния, подтвержденные данными транскриптомики и доступности хроматина. Данная разработка обеспечивает высокую интерпретируемость и точность при изучении того, как молекулярные сигналы организуют структуру тканей.
В исследовании, опубликованном в журнале npj Digital Medicine, представлена инновационная методология использования машинного обучения для интеграции мультиомных данных с целью прогнозирования эффективности терапии у пациенток с раком яичников. Авторы разработали модель слияния данных (multi-omics fusion), которая объединяет геномные, транскриптомные и протеомные профили для создания комплексного биомаркерного ландшафта. Применение алгоритмов машинного обучения позволило значительно повысить точность предсказания ответа на химиотерапию по сравнению с традиционными методами анализа одиночных типов данных. Результаты исследования демонстрируют, что такая интеграция данных способствует переходу к прецизионному общественному здравоохранению, позволяя персонализировать протоколы лечения на популяционном уровне. Данная работа имеет критическое значение для онкологии, так как предлагает инструмент для минимизации неэффективных терапевтических вмешательств и оптимизации выбора лекарственных препаратов на основе глубокого молекулярного профилирования.
Разработана нейросетевая модель OMNIS, которая интегрирует мультиомные данные в геномные изображения с учетом пространственной организации хромосом. Модель демонстрирует высокую точность в прогнозировании рецидивов рака и разграничении первичных и метастатических опухолей, а также позволяет выявлять ключевые гены-маркеры.
Исследование посвящено изучению специфического состояния микроглии (MG4), связанного с патологией болезни Альцгеймера (БА). С помощью интегративного анализа данных секвенирования РНК единичных ядер (snRNA-seq) из пяти независимых когорт (n=140 доноров) и подтверждения через ATAC-seq, ученые доказали воспроизводимость обогащения субпопуляции MG4 при БА (pooled log2 fold change = 0.90, p = 3.0 x 10^-4). В ходе работы были идентифицированы ключевые регуляторы MITF и BACH1, управляющие программой лизосомального закисления через V-ATPase и оттоком холестерина. Исследование выявило, что этот процесс отличается от программ DAM и LDAM, демонстрируя специфическое повышение энергетического метаболизма при БА. В качестве потенциальных апстрим-лигандов были определены FGF1 и TGFB2, что подтверждено пространственной транскриптомикой. Особую значимость для терапии представляет применение методов вычислительного репозиционирования лекарств, в результате которого было отобрано 10 соединений, способных проникать через гематоэнцефалический барьер, для дальнейшей функциональной валидации.
В исследовании представлен Histo3D-MO — инновационный гибридный экспериментально-вычислительный конвейер, предназначенный для реконструкции 3D-карт пространственного мультиомикса с разрешением на уровне отдельных клеток. Основная технология базируется на методе SPONGE, который интегрирует разреженные и несвязанные пространственные омиксные измерения с плотными данными гистологии (окрашивание гематоксилином и эозином). Разработанный алгоритмический комплекс позволяет проводить 3D-пропагацию типов клеток и аннотацию тканевых доменов, обеспечивая полную характеристику объема опухолевого микроокружения. При тестировании на данных гепатоцеллюлярной карциномы метод выявил сложные паттерны эффективности трансляции и траектории дифференцировки моноцитов в зависимости от глубины ткани. Histo3D-MO значительно превосходит существующие методы прогнозирования омиксных данных, предлагая масштабируемое решение для изучения организации сложных биологических систем. Это открывает новые возможности для высокоточной диагностики и понимания архитектуры опухолей на молекулярном уровне.
В статье представлен SHINE — инновационный вычислительный фреймворк на основе гиперграфов, предназначенный для совместного анализа пространственной экспрессии генов и метаболических сетей. Разработка решает критические проблемы мультиомиксных исследований: пространственное несовпадение данных, разницу в разрешении и сложные взаимодействия между транскриптомом и метаболомом. Методология SHINE использует обучение представлениям (representation learning) для интеграции данных, полученных с одного тканевого среза. В ходе тестирования на моделях болезни Паркинсона у мышей алгоритм успешно выявил области с истощением дофаминергических нейронов и реконструировал оси, связанные с дофамином. При анализе образцов рака легких и молочной железы у человека метод позволил точно сегментировать опухолевые микроокружения и идентифицировать пространственно организованные генно-метаболические программы. Технология демонстрирует высокую масштабируемость и точность в выявлении биомаркеров, что открывает новые возможности для прецизионной диагностики и понимания молекулярных механизмов заболеваний.
В статье представлен RomicsProcessor — инновационный программный пакет, разработанный для решения критической проблемы воспроизводимости в биоинформатике. Авторы предлагают парадигму «воспроизводимости по проекту», в основе которой лежит создание объекта 'Romics_object'. Этот цифровой артефакт является самодостаточным контейнером, который инкапсулирует полную историю данных: от исходного состояния до финальной обработки, включая все промежуточные шаги и зависимости. Методология была протестирована на различных сложных типах данных, включая объемную протеомику (bulk proteomics), крупномасштабную мультиплексную иммунофлуоресценцию и масс-спектрометрическую визуализацию (MSI) из нескольких партий. Результаты демонстрируют высокую масштабируемость и вычислительную мощность инструмента, обеспечивая соблюдение принципов FAIR (находимость, доступность, совместимость и повторное использование). Данная разработка служит фундаментом для создания следующего поколения биоинформатических инструментов, способных эффективно работать в эпоху искусственного интеллекта и ускорять биологические открытия.
В исследовании представлена новая мультиомиксная методология для функциональной характеристики фосфосайтов человека, которые до сих пор оставались малоизученными. Авторы предложили использовать обилие белков-партнеров в качестве индикатора влияния фосфорилирования на белковые взаимодействия, основываясь на том, что несвязанные субъединицы стабильных комплексов подвергаются деградации. С помощью модели вложенной линейной регрессии был проведен анализ пан-раковых данных 1 006 опухолей с учетом транскрипционных и других ковариат. В ходе работы выявлено 6 160 ассоциаций между 3 038 фосфосайтами и распространенностью взаимодействующих белков. Интеграция данных с предсказаниями AlphaFold позволила локализовать 239 сайтов непосредственно на интерфейсах взаимодействия, а еще 402 сайта были связаны с изменением локализации белков между клеточными компартментами. Экспериментальная проверка мутантов фосфосайтов NKAP и NUF2 методом масс-спектрометрии подтвердила точность предсказаний модели. Данный фреймворк создает структурированный ресурс для приоритезации изучения фосфопротеома человека.
Исследователи представили TMO (Temporal Multi-Omics) — инновационную архитектуру глубокого обучения, предназначенную для анализа временной динамики между доступностью хроматина (ATAC) и экспрессией генов (RNA). В отличие от существующих симметричных моделей, TMO использует механизм асимметричного кросс-модального внимания, что позволяет учитывать направленную связь и специфические временные задержки (regulatory lags), зависящие от текущего состояния клетки. Методология включает проекцию данных в латентные компоненты и использование двухпроходного трансформера с априорным смещением задержки, полученным через скользящую кросс-корреляцию. Тестирование на четырех наборах данных 10x Multiome (мозг и почки мышей, мозг и PBMC человека) показало выдающиеся результаты: показатели согласованности задержек (LCS) достигли 0.988–0.999 против 0.048–0.108 у симметричных моделей. Модель успешно выявила смену режимов регуляции: от ATAC-ведущего прайминга на ранних этапах развития до RNA-ведущей регуляции на поздних стадиях. Валидация через ChIP-seq и Perturb-seq (включая нокауты SMARCB1 и SMARCE1) подтвердила биологическую значимость выявленных паттернов, что делает TMO мощным инструментом для изучения механизмов клеточной дифференцировки и развития.
Исследователи представили HoloCell — первую в своем роде генеративную базовую модель (foundation model), предназначенную для совместного обучения представлениям и генеративного моделирования трех основных типов одноцепочечных омиксных данных: эпигеномики, транскриптомики и протеомики. Модель обладает колоссальным масштабом, содержая более 860 миллионов параметров, и прошла предварительное обучение на Human-Multi-Omics-Corpus, который включает около 468 миллионов профилей отдельных клеток и более 425 миллиардов токенов. В основе HoloCell лежит иерархическая стратегия токенизации, которая кодирует цис-регуляторные элементы, гены и белки как структурированные токены в единой архитектуре. Благодаря использованию механизмов итеративной диффузии и ремаскирования, модель демонстрирует превосходные результаты в задачах интеграции парных и непарных омиксных данных, а также в кросс-модальной генерации. HoloCell позволяет осуществлять in silico симуляцию потоков мультиомиксной информации, что делает её ключевым инструментом на пути к созданию концепции «виртуальной клетки». Это достижение открывает новые горизонты для системной характеризации клеточной гетерогенности и глубокого понимания биологических процессов на молекулярном уровне.
Исследование представляет Metadata Collector — специализированную веб-платформу (стек React/API/PostgreSQL), разработанную для решения проблемы хаотичного управления метаданными в проектах секвенирования следующего поколения (NGS). В рамках крупного немецкого исследовательского консорциума платформа была развернута в кластере Kubernetes для обеспечения соответствия принципам FAIR (находимость, доступность, совместимость и возможность повторного использования). Методология включает использование гибких машиночитаемых моделей данных, контролируемых словарей и системы версионирования на основе событий. В ходе эксплуатации система была применена в 32 проектах, охватывающих данные RNA-seq, scRNA-seq, ATAC-seq и мультиомные наборы, обеспечив аннотацию более 700 образцов от различных партнеров. Результаты демонстрируют, что внедрение платформы позволяет автоматизировать сбор данных и минимизировать ошибки ручного ввода, характерные для использования электронных таблиц. Инструмент имеет высокую значимость для организации биомедицинских исследований, так как позволяет интегрировать стандартизированные метаданные в существующие инфраструктуры управления данными и будущие конвейеры автоматизированной подачи в публичные репозитории.
В статье рассматривается критическая проблема интеграции искусственного интеллекта и мультиомиксных технологий (геномики, протеомики и др.) в практику прецизионной медицины. Авторы подчеркивают, что текущие регуляторные механизмы не успевают за темпами технологического прогресса, создавая разрыв между инновациями и их клиническим внедрением. Основное внимание уделяется вопросам целостности данных, прозрачности алгоритмов и необходимости интеграции доказательств из реальной клинической практики (RWE). В работе проводится сравнительный анализ регуляторных подходов в ЕС и США, выявляя существенные различия в классификации инструментов как медицинских изделий или фармацевтических препаратов. Исследование акцентирует внимание на необходимости создания новых стандартов валидации для ИИ-систем, которые анализируют сверхсложные биологические наборы данных. Результаты дискуссии указывают на то, что гармонизация правил станет ключевым фактором для безопасного и массового использования инструментов следующего поколения в диагностике и стратификации пациентов.
Исследователи представили PACMON — новую байесовскую модель латентных факторов, предназначенную для интерпретации результатов высокопроизводительного скрининга генов. В отличие от существующих методов, PACMON объединяет мультимодальные молекулярные измерения (например, РНК и поверхностные белки) с априорными биологическими знаниями о путях. Модель использует структурированные разреженные априорные распределения для сопоставления латентных факторов с известными биологическими путями, одновременно оценивая, как различные экспериментальные воздействия (пертурбации) активируют или подавляют эти программы. Тестирование на синтетических данных показало практически идеальное восстановление структуры путей, превосходящее текущие методы по точности и масштабируемости. При применении к данным Perturb-CITE-seq клеток меланомы модель успешно выявила программы интерферонного сигналинга и клеточного цикла. Особую значимость представляет применение PACMON к атласу пертурбаций Tahoe-100M, охватывающему около 100 миллионов клеток и более 1000 комбинаций доз лекарств, что позволило впервые провести анализ латентных факторов на уровне путей в таком масштабе и картировать ландшафты лекарственного ответа.
Исследователи представили Lemonite — новый вычислительный фреймворк, предназначенный для интеграции данных транскриптомики и метаболомики с целью выявления метаболитов, регулирующих экспрессию генов. В отличие от существующих методов, Lemonite не требует предварительного дифференциального анализа или полной аннотации метаболитов, что позволяет преодолеть ограничения интерпретируемости. Для контекстуализации прогнозов авторы создали масштабный граф знаний, объединяющий более 370 000 взаимодействий метаболит-ген и 2,1 миллиона белок-белковых взаимодействий. Применение метода к когортам пациентов с глиобластомой и воспалительными заболеваниями кишечника позволило выявить более 50 функционально когерентных генных модулей на каждую болезнь. В частности, при глиобластоме было установлено, что мио-инозитол и фосфатидилхолины совместно с фактором IRF6 регулируют мезенхимальные иммунные программы, локализованные в опухолевых макрофагах. Метод позволяет генерировать проверяемые экспериментально гипотезы, расширяя понимание регуляторного потенциала метаболома в рамках мультиомиксного анализа.
Исследователи представили MAAMOUL — новый вычислительный фреймворк, предназначенный для интеграции метагеномных и метаболомных данных с целью выявления функциональных изменений в микробиоме, связанных с заболеваниями. В отличие от традиционных методов, которые опираются на фиксированные границы метаболических путей, MAAMOUL использует знания о бактериальном метаболизме для построения глобальной сети и идентификации кастомных метаболических модулей. Применение метода к наборам данных пациентов с воспалительными заболеваниями кишечника (ВЗК/IBD) и синдромом раздраженного кишечника (СРК/IBS) показало высокую эффективность: были обнаружены специфические модули, которые пропускали стандартные методы анализа путей. В частности, при ВЗК выявлены нарушения метаболизма серы и ароматических аминокислот, а также усиление механизмов спасения нуклеотидов микробиомом. Для СРК характерны изменения в метаболизме пуринов и никотината/никотинамида. Данный подход позволяет проводить глубокую мультиомиксную интеграцию, раскрывая когерентные функциональные сдвиги, недоступные при раздельном анализе генов или метаболитов.
Представлена новая аналитическая платформа Shiny AMMOA, разработанная как графический интерфейс (GUI) на базе R Shiny для упрощения интегративного анализа мультиомных данных при изучении старения мышей. Инструмент позволяет исследователям проводить сквозной анализ транскриптомных, протеомных и метаболомных данных без необходимости глубоких навыков программирования. Платформа поддерживает тестирование дифференциальной экспрессии, анализ обогащения путей и визуализацию молекулярных изменений на диаграммах KEGG. В ходе тестирования Shiny AMMOA успешно воспроизвела ключевые результаты существующих исследований, выявив возрастные изменения в таких процессах, как ответ на несвернутые белки (UPR), организация внеклеточного матрикса и метаболические пути. Продукт демократизирует доступ к сложным биоинформатическим методам, позволяя экспериментальным биологам быстро приоритизировать биологические мишени и генерировать гипотезы на системном уровне. Платформа доступна как локально через GitHub, так и в облегченном веб-варианте.