В данном исследовании представлен комплексный вычислительный анализ транскриптомных профилей пациентов с болезнями Альцгеймера, Паркинсона и Гентингтона для выявления общих патофизиологических механизмов. Авторы идентифицировали 274 общих дифференциально экспрессируемых гена и три ключевых обогащенных пути, которые активированы при всех трех заболеваниях. Среди них выделены пути, связанные с воспалительной сигнализацией через транскрипционный фактор NF-kappaB, и путь регуляции транскрипции BCL2L11 с помощью RUNX3. В качестве наиболее перспективных мишеней для терапии были определены пять генов: NFKBIA, NFKB1, RELA, TRIM4 и SMAD4, демонстрирующих значительную ап-регуляцию. На основе анализа было предложено репозиционирование уже одобренных FDA препаратов, включая антигиперлипидемические, антигипертензивные, антидиабетические и другие средства, для лечения этих нейродегенеративных состояний. Исследование подчеркивает потенциал использования биоинформатики для ускорения разработки терапии через использование существующих лекарственных средств.
Статья представляет BloClaw — рабочую станцию для научных исследований с искусственным интеллектом (AI4S), предназначенную для аудируемой вычислительной биологии. Основной принцип системы: научный агент должен знать, что он может делать, показывать, как он это сделал, и указывать, что осталось непроверенным. Каждая функциональная возможность описывает состояние выполнения, ограничения входных данных, зависимости, ожидаемые результаты и научные ограничения. Запросы на естественном языке преобразуются в структурированные задачи, проверяются на соответствие реестру возможностей, выполняются с помощью научных инструментов и записываются в журнал Living Lab Notebook с отслеживанием происхождения данных. Система обнаруживает недопустимые входные данные, сбои вызовов инструментов, отсутствующие зависимости и тайм-ауты, направляя их на исправление, повторную попытку или эскалацию. Реализованный и протестированный функционал включает скрининг молекулярных свойств и правил на основе RDKit, анализ структуры белков, проверку поз докинга, 3D-визуализацию и структурированную отчетность. Демонстрация на структуре осимертиниба из PubChem и артефакте докинга 6LU7 показала детерминированные дескрипторы (молекулярная масса 499.619 Да, cLogP 4.5098, TPSA 87.55 Ų) и 2387 записей атомов белка, 309 остатков и девять записей поз. Авторы подчеркивают, что это демонстрация рабочего процесса, а не исследование эффективности или сродства. Также описана предлагаемая конструктивная модель с минимизацией априорных предположений, где целевая функция компилируется в физические, химические и системные ограничения, а наблюдения используются для калибровки и фальсификации. Описан протокол оценки, сравнивающий BloClaw со стандартным однопроцессным агентом и фиксированными скриптами по полноте задач, научной корректности, успешности восстановления, полноте происхождения, воспроизводимости, времени рецензирования, задержке и стоимости. Система позиционируется как уровень исполнения и подотчетности для ИИ-ассистированных исследований, дополняющий экспертный анализ и экспериментальную валидацию.
Исследователи разработали CHASM — вычислительный метод для обнаружения хромосомных копийных альтераций (CNA) из данных одноклеточной хроматиновой доступности (scATAC-seq). Метод оценивает фон CNA-null для каждой клетки, обеспечивая индивидуализированное ожидание хромосомной доступности, что критически важно в не-неопластических тканях. Валидация проведена через in silico spike-in эксперименты, кросс-модальные сравнения с одноклеточными ДНК и РНК данными, включая контрасты нестабильности генома (дефицит p53, потеря Y-хромосомы). Применённый к 99 образцам человеческой почки, CHASM выявил обогащение мозаичных хромосомных альтераций (mCA) в ассоциированных с повреждением клеточных состояниях (VCAM1-высокие клетки проксимальных канальцев). Метод обнаружил возраст-ассоциированное появление mCA в релевантных для рака геномных регионах, включая_gain и потерю хромосомы 3, gain хромосомы 7 в нормальных популяциях клеток. Клетки с mCA демонстрируют активацию регуляторных программ ответа на повреждение и сниженную эпителиальную идентичность, а повышенная нагрузка mCA в специфических эпителиальных популяциях ассоциирована с увеличенной иммунной и стромальной инфильтрацией. CHASM раскрывает паттерны нестабильности генома при старении внутри типов клеток и implicирует mCA в ранних, пред-болезненных клеточных состояниях.
Исследователи представили PLMView — новую вычислительную платформу на основе языковых моделей белков (PLM) для классификации функций белков с высокой точностью. Метод работает без размеченных данных, специфичного обучения для семейств белков или дообучения PLM, позиционируя последовательности в совместном функциональном пространстве через сравнение с якорными последовательностями. Платформа демонстрирует высокую вычислительную эффективность: классификация примерно 10 000 последовательностей с 1 000 якорей выполняется менее чем за 40 минут, что более чем в 10 раз быстрее реконструкции сетей сходства последовательностей (SSN) на данных такого масштаба. PLMView превосходит методы пулинговых эмбеддингов и SSN по биологической согласованности функционального разрешения, особенно в сложных случаях. Применения метода включают анализ тиоредоксинов, визуальных опсинов и холод-шок белков диатомовых водорослей из проекта Tara Oceans, демонстрируя переход от интерпретируемых детерминант на уровне остатков в изученных семействах к крупномасштабному экологическому открытию функций. Метод выявляет остатки, вероятно определяющие функциональную специфичность, связывая молекулярную специализацию с экологическим распределением и транскрипционной активностью в глобальном океане.
Исследование посвящено компьютерному дизайну пептида для таргетного воздействия на иммунную контрольную точку Tim-3–galectin9, что имеет значение для иммунотерапии онкологических заболеваний. Работа опубликована в журнале npj Digital Medicine, специализирующемся на цифровых технологиях в медицине. Методология предполагает использование вычислительных подходов для многокритериальной оптимизации пептидной структуры с целью достижения специфичности связывания и терапевтической эффективности. Tim-3 и galectin9 представляют собой перспективные мишени для преодоления иммунного ускользания опухолей. Однако предоставленный фрагмент содержит только библиографические метаданные без доступа к полному тексту статьи, поэтому детали алгоритмов оптимизации, конкретные результаты экспериментов и количественные показатели эффективности недоступны для анализа. Для полноценной оценки вклада ИИ-методов в данное исследование необходим доступ к разделам методики и результатов публикации.
Исследователи разработали BIGraph-ST — новый метод на основе графовых нейронных сетей для идентификации функциональных доменов в пространственной транскриптомике. Метод интегрирует два типа данных:_scores активности биологических путей и признаки гистологических изображений, что позволяет преодолеть шум и разреженность данных экспрессии генов. BIGraph-ST представляет сходство между модальностями через аффинные графы и распространяет пространственную топологию для захвата связности высшего порядка в тканевом микроокружении. Экспериментальные результаты показали робастную производительность и значительные улучшения на множестве бенчмарк-датасетов, особенно на образцах раковых тканей. Ключевое преимущество метода — биологически интерпретируемые представления доменов на уровне путей, что даёт исследователям инструмент для получения биологических инсайтов о сложных тканевых архитектурах. Исходный код будет опубликован после принятия статьи. Данная работа напрямую применяет методы машинного обучения для анализа медицинских данных в онкологии и патологической анатомии.
Исследователи разработали новый метод глубокого обучения для молекулярной динамики, который позволяет проводить симуляции на значительно более длительных временных масштабах по сравнению с существующими подходами. Ключевое достижение метода — преодоление традиционного фемтосекундного ограничения при сохранении точности предсказания физических свойств молекул. Технология опубликована в журнале Nature Machine Intelligence 5 августа 2026 года. Метод использует нейросетевое прогнозирование траекторий молекулярного движения, что открывает возможности для более эффективного моделирования биомолекулярных процессов. Данное исследование имеет потенциальное значение для фармацевтической разработки и дизайна лекарств, где молекулярная динамика применяется для изучения взаимодействий белков и лигандов. Однако статья не содержит конкретных количественных результатов или данных о клинических применениях, что ограничивает прямую оценку медицинской релевантности.
Исследователи представили MAXWELL (Matrix-wise Landscape Learning) — новый метод пост-обучения для калибровки вероятностных выходов языковых моделей белков с целью прогнозирования влияния мутаций на стабильность белков. Метод позволяет генерировать мутационные ландшафты, количественно оценивающие эффекты отдельных аминокислотных замен на стабильность белка, что критически важно для белковой инженерии и разработки терапевтических препаратов. При применении к модели ProteinMPNN MAXWELL продемонстрировал результаты уровня state-of-the-art, превзойдя ThermoMPNN и другие представительные методы на курированном бенчмарке экспериментально измеренных изменений стабильности. Экспериментальная валидация включала дизайн десяти точечных мутаций в дегалогеназе DhaA, из которых семь (70%) увеличили термическую стабильность белка. Наибольшее улучшение показала мутация G171W с измеренным значением ΔT 4.91°C. Эти результаты подтверждают MAXWELL как практическую стратегию для дизайна стабилизирующих мутаций с потенциальным применением в разработке ферментных терапевтических препаратов и биотехнологии.
OpenAntigens — это бесплатная база данных без регистрации, предоставляющая отчёты по дизайну конструктов для 5328 человеческих секретируемых, GPI-якорных, однопроходных и многопроходных белков поверхности клеток. Система интегрирует данные UniProt о топологии, предсказания структуры AlphaFold (pLDDT и PAE), информацию из PDB, домены InterPro и Pfam, ортологи мыши и cynomolgus, контекст паралогов, ассоциации с заболеваниями Open Targets, а также результаты BLAST-поиска. База предлагает 55 305 вариантов конструктов, включая полные регионы дизайна, границы на основе PDB, аннотированные домены, регионы на основе pLDDT/PAE и опции экспрессии мембранных белков, плюс 148 722 хита по сходству последовательностей для оценки кросс-реактивности. Для мишеней с совместимыми моделями AlphaFold интерактивный дизайнер связывает последовательность, структуру и метрики качества, позволяя редактировать границы и экспортировать эквивалентные последовательности видов с предупреждениями о цистеинах и модификациях в реальном времени. Инструмент сокращает необходимость ручной сверки данных из множества ресурсов, объединяя воспроизводимые предложения конструктов, сравнительный контекст и браузерное редактирование в едином рабочем процессе. Это ускоряет разработку антител, рекомбинантных реагентов и вычислительный дизайн байндеров, что критически важно для фармацевтических исследований и открытия новых терапевтических мишеней.
Исследователи разработали инновационную вычислительную систему на основе искусственного интеллекта для идентификации лекарственных мишеней среди малоизученных «тёмных киназ» — белков, которые могут стать ключом к лечению сложных заболеваний, включая рак и нейродегенеративные расстройства. Методология объединяет BERT-эмбеддинги белков и путей, двухступенчатый трансформер, гетерогенный графовый трансформер (HGT), а также генеративно-состязательную сеть WGAN-GP для создания негативных примеров обучения. Модель обучена на классификаторах XGBoost и lightGBM с интерпретацией результатов через SHAP-анализ для объяснимости. Система достигла выдающихся метрик: точность 98,16%, F1-мера 98,16%, специфичность 98,52%, AUROC 99,78%, AUPRC 99,82%, корректно классифицировав 97,48% тестовых данных. В результате предсказано 62 225 ассоциаций путей для тёмных киназ, проанализирована функциональная схожесть 96 белков и выявлено 9 ключевых признаков. Особое внимание уделено киназам, связанным с синдромом поликистозных яичников (СПКЯ), для которых проведён докинг-анализ с известными препаратами. Работа демонстрирует практическую применимость ИИ для ускорения открытия лекарств и функциональной аннотации белков.
Исследователи разработали интегрированный экспериментальный и вычислительный конвейер для аннотации клеток на уровне белков с применением масс-спектрометрии единичных клеток (SCP). Методология включала изоляцию T-клеток, B-клеток, моноцитов и NK-клеток методом негативной селекции для создания высокоточного референса, параллельно несортированные PBMC обрабатывались на системе cellenONE с детекцией label-free DIA на масс-спектрометре Orbitrap Astral Zoom. Авторы систематически бенчмаркили методы нормализации, импутации и кластеризации для оценки их влияния на разделение типов клеток. Ненаблюдаемый анализ разрешил функциональные субпопуляции внутри каждой линии, а вероятностный SCP-классификатор, обученный на этих аннотациях, идентифицировал соответствующие типы клеток и состояния в несортированной фракции PBMC. Работа предоставляет аналитически бенчмаркированный SCP-воркфлоу с готовым к использованию белковым референсом для присвоения иммунных клеток. Вычислительные методы включают машинное обучение для классификации клеточных типов, что имеет значение для иммунологических исследований и персонализированной медицины.
Исследователи представили Boltz2ESI — новую вычислительную платформу на основе фундаментальной модели ИИ для предсказания взаимодействий между ферментами и субстратами. В отличие от традиционных методов докинга, требующих предопределённых активных центров, Boltz2ESI использует端到端ное совместное сворачивание (co-folding), что позволяет естественным образом учитывать пластичность активного сайта и конформационные изменения при связывании лиганда. Модель интегрирует биофизические приоры, глобальный эволюционный контекст и геометрические молекулярные дескрипторы, демонстрируя превосходство над современными последовательностными методами и подходами жёсткого докинга. Валидация показала способность системы точно различать специфичность внутри подсемейств ферментов, что продемонстрировано на примере пути биосинтеза витанолидов. Технология потенциально применима для ускорения открытия биокатализаторов и масштабного определения функций орфанных ферментов в синтетической биологии и фармацевтической разработке. Прямое клиническое применение не заявлено, но метод может способствовать дизайну лекарств и метаболической инженерии.
Исследователи разработали PhyloFM — фреймворк на основе flow-matching (машинное обучение), который интегрирует разнородные данные lineage-tracing с одноклеточной РНК-секвенацией и пространственной транскриптомикой для реконструкции непрерывной динамики клеточных судеб. Метод обучает поле скоростей и изменения относительной численности клеток на топологически регуляризованной латентной геометрии, предсказывая транспорт популяций, вероятности будущих судеб, время коммитмента и динамику экспрессии генов. PhyloFM протестирован на пяти бенчмарках: эмбриогенез C. elegans, гемопоэз LARRY, развитие вентрального среднего мозга pandaCREST, регенерация сердца у данио-рерио и пространственные опухоли eTracer. На данных C. elegans метод улучшил транспорт популяций на 17,3% и снизил ошибку динамики на 16,3% относительно state-of-the-art базлайнов, с уменьшением ошибки транспорта на 26,6% относительно lineage-aware контроля. На бенчмарке пространственных опухолей eTracer точность судьбы клонов увеличилась на 70,4% относительно лучшего пространственного базлайна, а 67% сопоставленных генов-репортёров показали корреляцию Пирсона r > 0,6. Результаты демонстрируют, что записи клеточного происхождения могут служить биологическими ограничениями для реконструкции интерпретируемой молекулярной динамики из одноклеточных снимков, что имеет значение для онкологии, регенеративной медицины и изучения развития тканей.
Исследователи разработали SpaTemGRN — вычислительный метод для анализа пространственно-временной транскриптомики, который позволяет восстанавливать генно-регуляторные сети с разрешением по времени и пространству. Метод использует совместное моделирование наблюдений с нескольких слайдов в разные моменты времени, позволяя поздним пространственным единицам заимствовать статистическую силу у соседних и предшествующих во времени единиц. В модели болезни Альцгеймера у мышей (AppNL-G-F) метод выявил зависящее от региона и возраста усиление регуляторной связи между комплементом и глиальными клетками: ранний широко распределённый сигнатурный профиль комплемента предшествует более поздней пространственно-фокальной связи с астроцитарными и микроглиальными ответами. В развивающемся эмбриональном мозге мыши SpaTemGRN идентифицировал прогрессирующее sharpening и пространственное разделение регуляторных программ по мере регионализации нервной трубки. На симулированных данных метод превзошёл четыре существующих подхода по точности восстановления регуляторных связей и продемонстрировал наиболее стабильную производительность across стадий развития. Исследование представляет собой гибкий гипотез-генерирующий фреймворк для изучения ремоделирования пространственно-локализованных генно-генных зависимостей across биологических стадий, что имеет значение для понимания молекулярных механизмов нейродегенеративных заболеваний.
Исследователи представили vOMIX-MEGA — новый вычислительный фреймворк для анализа вирусных метагеномных данных терабайтного объёма. Основная проблема, которую решает инструмент — ограничения масштабируемости и вычислительных ресурсов при идентификации вирусов в больших наборах данных. vOMIX-MEGA оптимизирует параллелизацию и использование памяти на критических этапах обработки. По результатам бенчмарков на эмпирических данных, пайплайн завершает обработку за 50 минут с потреблением 24 ГБ оперативной памяти, тогда как четыре альтернативных решения требуют от 7 часов (383 ГБ RAM) до 14 дней (32 ГБ RAM). По точности vOMIX-MEGA превосходит существующие аналоги в среднем на 21% на тестовых (mock) данных и на 13% на экспериментальных данных. Инструмент имеет прямое применение в медицинской диагностике для быстрого выявления патогенов, мониторинга вспышек заболеваний и клинического секвенирования. Исходный код доступен в открытом доступе на GitHub.
Исследование представляет комплексную оценку возможностей AlphaFold3 — системы искусственного интеллекта для предсказания связывания антител с антигенами. Авторы проанализировали 3401 экспериментально подтверждённый комплекс антитело-антиген из Structural Antibody Database вместе с 23798 негативными контролями. Максимальная полнота (recall) составила 53% при 100 семенах инференса, при этом выявлен врождённый уровень ложноположительных результатов около 3%. Обнаружено систематическое смещение: модель лучше предсказывает антитела из рентгеновской кристаллографии по сравнению с электронной микроскопией, а точность снижается с увеличением размера и площади поверхности целевого белка. Важно, что 34% ложноотрицательных предсказаний сохраняли правильную локализацию эпитопа несмотря на плохое структурное выравнивание, что указывает на возможность улучшения результатов инструментами конформационной доработки. Исследование демонстрирует как потенциал AlphaFold3 для скрининга антител в вычислительной разработке лекарств, так и его ограничения, включая тенденцию к галлюцинации правдоподобных интерфейсов связывания на поверхности фиктивных мишеней.
Исследователи разработали CLEAR-Lactyl — курированный эталонный набор данных человеческого лактилирования лизина, включающий 16 604 положительных сайта модификации. На его основе создан AttentionKla — фреймворк глубокого обучения, использующий предобученную языковую модель белков, дообученную с помощью технологии LoRA (Low-Rank Adaptation). Метод значительно превосходит существующие инструменты предсказания сайтов лактилирования, что подтверждено комплексными абляционными исследованиями. Практическая полезность подхода экспериментально валидирована в клеточных анализах: система способна предсказывать новые сайты лактилирования и осуществлять направленную модуляцию уровней модификации через последовательность. Лактилирование лизина — динамическая посттрансляционная модификация, влияющая на функцию белков и связанная с разнообразными физиологическими и патологическими процессами, включая воспалительные заболевания и онкологию. Результаты предоставляют исследователям мощную платформу для изучения регуляторного ландшафта лактилирования и генерирования проверяемых гипотез о связанных механизмах. Фреймворк является расширяемым и может быть адаптирован для точной модуляции других посттрансляционных модификаций белков.
В статье представлен PMBB Geno-Pheno Toolkit — специализированный набор модульных конвейеров на базе Nextflow, предназначенный для проведения масштабных ассоциативных анализов в биобанках, связанных с электронными медицинскими картами (EHR). Основная проблема, которую решает инструмент, заключается в фрагментации данных и несовместимости вычислительных инфраструктур различных институтов. В состав набора входит семейство конвейеров SAIGE, поддерживающих полногеномный (GWAS), экзомный (ExWAS) и феномновый (PheWAS) анализы, а также инструменты GWAMA и ExWAS для проведения мета-анализов и репликации результатов между различными биобанками. Все компоненты системы контейнеризированы с использованием Docker и Apptainer, что обеспечивает беспрепятственный запуск рабочих процессов на локальных HPC-кластерах, облачных платформах и в среде All of Us Research Workbench без необходимости изменения кода. Дополнительно инструментарий включает возможности для полигенного скоринга, гармонизации фенотипов и LD-клампинга на базе PLINK. Данная разработка значительно повышает воспроизводимость и масштабируемость биомедицинских исследований, позволяя объединять разрозненные геномные и фенотипические наборы данных.
В данной научной работе представлен переработанный фреймворк логистической регрессии, специально оптимизированный для классификации и отбора признаков в условиях высокой размерности биомедицинских данных. Основная проблема, решаемая авторами, заключается в ограничении классической логистической регрессии, когда количество генетических признаков многократно превышает количество доступных образцов. Методология была протестирована на трех различных биомедицинских наборах данных, охватывающих сценарии с десятками тысяч атрибутов при существенно малом объеме выборки. Результаты исследования показали способность модели обеспечивать четкое разделение между контрольными группами и группами пациентов с заболеваниями, одновременно выделяя компактный набор наиболее значимых генов. Важным достижением является то, что часть выбранных признаков совпала с уже известными биомаркерами заболеваний, что подтверждает биологическую достоверность модели, а другие признаки указывают на потенциально новые мишени для дальнейших исследований. Данный подход предлагает интерпретируемую и вычислительно эффективную альтернативу существующим методам в области вычислительной биологии.
Исследователи разработали CDRPipe (Computational Drug Repurposing Pipeline) — единую вычислительную платформу для ускоренного поиска новых применений существующих лекарств на основе анализа транскриптомных сигнатур. Методология заключается в гармонизации данных микрочипов из базы Connectivity Map (1 968 экспериментов) с псевдо-bulk профилями, полученными из масштабных данных секвенирования РНК единичных клеток базы Tahoe-100M (56 827 экспериментов). В ходе тестирования на 233 сигнатурах заболеваний было установлено, что профили единичных клеток демонстрируют значительно более высокую эффективность: медианная полнота охвата (recall) составила 50,0% против 6,2% у микрочипов (p < 10^-11). Ключевым открытием стало то, что данные двух технологий крайне мало пересекаются (всего 3,5% общих препаратов), что делает их интеграцию критически важной для расширения терапевтического охвата. Использование CDRPipe позволяет выявлять высокоточные консенсусные кандидаты, что подтверждено успешными кейсами в области аутоиммунных заболеваний и эндометриоза. Данный подход существенно повышает надежность и интерпретируемость процесса перепрофилирования лекарственных средств с помощью ИИ и биоинформатики.