В статье представлен конвейер in silico, который использует условную языковую модель Finenzyme для генерации ферментных последовательностей, а затем оценивает их структурную стабильность с помощью симуляций молекулярной динамики. Симуляции 236 ферментов из четырёх классов EC показали, что 82,6% структур сохраняют стабильность, что подтверждает потенциал подхода для биомедицинских и промышленных применений.
В статье рассматривается проблема оценки предсказателей чисел оборотов ферментов (kcat), которые критически важны для кинетических моделей и фермент-ограниченных геномных масштабных метаболических моделей (ecGEM). Из-за нехватки экспериментальных данных kcat всё чаще оценивают с помощью машинного обучения (ML), однако стандартные метрики регрессии не отражают практическую применимость этих моделей. Авторы провели бенчмаркинг шести современных предсказателей kcat на курируемом наборе данных на основе BRENDA и пяти из них на наборе EnzyExtract, сравнивая также близость обучающих выборок. Затем они использовали предсказанные значения для параметризации ecGEM Saccharomyces cerevisiae и оценили предсказания роста в 19 условиях. Результаты показали, что точность бенчмарков умеренная даже на BRENDA и резко падает на EnzyExtract, где все предсказатели достигают R² не выше 0.20. Совпадение последовательностей с обучающими данными составило 24–78% для BRENDA и 9–26% для EnzyExtract, но это не объясняет различий в обобщении. Более того, ранжирование по бенчмаркам не соответствовало качеству downstream-предсказаний: в глюкозной минимальной среде самый слабый по бенчмарку предсказатель дал наиболее точный прогноз роста, а более высокорейтинговые модели — большие отклонения. Причиной оказались локальные ошибки в высоконагруженных позициях метаболической сети, в частности заниженные значения kcat для митохондриального ADP/ATP-переносчика, что ограничивало обмен адениновых нуклеотидов и приводило к кажущемуся дефициту цитозольного АТФ. Снятие этого ограничения сместило предсказанный рост к экспериментальному. Авторы делают вывод о необходимости прикладной валидации предсказателей биологических параметров в тех системах, для которых они предназначены.
Исследователи представили Boltz2ESI — новую вычислительную платформу на основе фундаментальной модели ИИ для предсказания взаимодействий между ферментами и субстратами. В отличие от традиционных методов докинга, требующих предопределённых активных центров, Boltz2ESI использует端到端ное совместное сворачивание (co-folding), что позволяет естественным образом учитывать пластичность активного сайта и конформационные изменения при связывании лиганда. Модель интегрирует биофизические приоры, глобальный эволюционный контекст и геометрические молекулярные дескрипторы, демонстрируя превосходство над современными последовательностными методами и подходами жёсткого докинга. Валидация показала способность системы точно различать специфичность внутри подсемейств ферментов, что продемонстрировано на примере пути биосинтеза витанолидов. Технология потенциально применима для ускорения открытия биокатализаторов и масштабного определения функций орфанных ферментов в синтетической биологии и фармацевтической разработке. Прямое клиническое применение не заявлено, но метод может способствовать дизайну лекарств и метаболической инженерии.
В исследовании представлен EditorForge — инновационный модульный фреймворк, предназначенный для прецизионного редизайна белков, таких как ферменты и геномные редакторы. Основная проблема существующих моделей обратного фолдинга заключается в том, что неконтролируемый редизайн может повредить критически важные каталитические и консервативные участки. Авторы предложили систему, которая сочетает фиксированный фолдинг с использованием масок дизайна, принудительным сохранением позиций и аудитом близости к активному центру. В качестве демонстрации использовалась структура обратной транскриптазы вируса лейкоза мыши (MMLV RT 4MH8), где редизайн был ограничен областью из 25 позиций при фиксации 428 остальных остатков. Благодаря модулю Active Site Shield удалось выявить и исключить небезопасные позиции, заменив их на альтернативы с меньшим уровнем контактов. Итоговые 8 отобранных кандидатов успешно прошли контроль качества (RefoldQC) с высокими показателями: глобальный C RMSD составил 1.20–1.55 Å, а средняя уверенность (pLDDT-like) достигла 94.87–95.11. Этот инструмент позволяет превращать общие результаты моделей обратного фолдинга в специализированные наборы белков, готовые к биологическому тестированию.
Исследование посвящено решению проблемы фрагментации и несогласованности аннотаций ферментов суперсемейства цитохрома P450 (CYP) в структурных репозиториях. Авторы разработали инновационный рабочий процесс, сочетающий поиск по ключевым словам, скрытые марковские модели (HMM) и структурное выравнивание для надежного обнаружения и верификации белков. В ходе работы было идентифицировано 1 513 депозитов, представляющих 674 уникальные последовательности, которые прошли повторную аннотацию через сервер P450Atlas и ручную проверку. В результате исследования было обнаружено пять новых подсемейств CYP. Созданный набор данных представляет собой первый строго курируемый реестр ферментов P450, интегрированный в общедоступный ресурс с поддержкой автоматизированного конвейера для сканирования новых поступлений. Данная методология критически важна для фармакологии и биотехнологии, так как обеспечивает точный поиск и стандартизированную номенклатуру для крупномасштабного анализа структурных данных.
В исследовании представлен SelectZyme — инновационный фреймворк для поиска новых ферментов, использующий эмбеддинги языковых моделей белка (Protein Language Models). Методология объединяет векторные представления белков с методами снижения размерности, иерархической кластеризацией и количественным анализом дендрограмм, что позволяет исследовать биологические последовательности без привязки к фиксированным порогам сходства или заранее известным аннотациям. В ходе тестирования на массиве данных из более чем 100 000 последовательностей PETase (ферментов, расщепляющих пластик), система продемонстрировала способность сохранять структурную целостность фолдов даже в «сумеречной зоне» сходства последовательностей. Ключевым преимуществом является переход от простого фильтрания по сходству к структурированному исследованию латентного пространства, что позволяет выявлять биологически значимые функциональные организации в полностью неконтролируемых (unsupervised) условиях. Данный подход обеспечивает масштабируемую основу для направленного поиска биокатализаторов и служит эффективной отправной точкой для последующей белковой инженерии и разработки новых лекарственных средств.
В исследовании представлен комплексный бенчмарк эффективности белковых языковых моделей (PLM), таких как ESM2 (650M и 3B параметров) и ProtT5-XL, для предсказания номеров Enzyme Commission (EC), что критически важно для аннотации геномов и биоинженерии. Авторы протестировали 1296 моделей, комбинируя три архитектуры PLM с девятью нейросетевыми архитектурами на четырех уровнях иерархии EC и различных порогах идентичности последовательностей. Результаты показали, что простые MLP-классификаторы достигают точности до 98.0% на уровне EC1 и около 97.0% на уровне EC4, сопоставимо с BLAST для белков из обучающей выборки. Однако при работе с эволюционно отдаленными эукариотами (например, Giardia lamblia) модели на базе PLM показали колоссальное превосходство над BLAST, увеличив точность на 31.8 процентных пункта по сравнению с базовой линией в 90 тысяч последовательностей. Для прокариотических протеомов среднее преимущество PLM перед BLAST составило +16.9 процентных пункта на уровне EC4. Исследование также выявило, что архитектура MLP является наиболее эффективной, а использование ESM2-650M практически не уступает по результатам значительно более крупной модели ESM2-3B.
Исследование представляет PlantP450Dock — новый автоматизированный программный конвейер, предназначенный для ускорения функциональной аннотации растительных ферментов цитохрома P450 (CYPs). Основная проблема текущих методов заключается в невозможности использования структур AlphaFold без учета гемового кофактора и сложности выбора гибких остатков активного центра. Разработанный метод интегрирует алгоритм локального преобразования координат для переноса гема из кристаллографических шаблонов в модели AlphaFold с точностью отклонения менее 0,2 Å. Использование молекулярной динамики (100 нс) подтвердило стабильность координационной геометрии Fe-S (2,61 ± 0,08 Å). Благодаря стратегии фильтрации на основе сингулярного разложения (SVD), система автоматически определяет гибкие остатки без участия оператора. Валидация на четырех различных семействах (CYP73, CYP711, CYP706 и CYP701) показала получение каталитически компетентных поз связывания с расстоянием от субстрата до железа в пределах 2,8–4,4 Å. Данный инструмент станет доступен в виде веб-сервера, что значительно упростит поиск новых метаболитов в растениеводстве.
В исследовании представлен CatIF-RL — инновационный фреймворк, предназначенный для направленного проектирования вариантов ферментов с повышенной каталитической активностью. В основе метода лежит графовая диффузионная модель обратного фолдинга белков, которая была адаптирована под специфические структурные данные ферментов. Авторы внедрили механизм оптимизации, использующий прогнозируемую константу скорости катализа (kcat) в качестве целевого сигнала, применяя метод оптимизации политики относительно группы (GRPO). В ходе тестирования на независимых бенчмарках CatIF-RL продемонстрировал четырехкратное увеличение прогнозируемого значения kcat по сравнению с природными ферментами, значительно превзойдя существующие методы обратного фолдинга. При этом модель успешно сохраняет структурную точность и показатель восстановления последовательности (sequence recovery) на уровне 0.55, что позволяет проводить частичное проектирование с сохранением ключевых функциональных мотивов. Данная работа открывает новые возможности для функциональной оптимизации белков в биоинженерии и фармацевтике.
Исследователи представили evedesign — открытую унифицированную платформу для машинного обучения в биоинженерии белков, которая решает проблему несовместимости существующих инструментов. Framework формализует условный дизайн биологических последовательностей метод-агностичным способом, позволяя комбинировать supervised и unsupervised модели из стандартизированных спецификаций. Ключевая особенность — поддержка итеративных lab-in-the-loop рабочих процессов, где экспериментальные данные непрерывно уточняют последовательные раунды дизайна. Платформа включает интерактивный веб-интерфейс для end-to-end дизайна, доступный широкой научной аудитории по адресу evedesign.bio. Авторы продемонстрировали полезность evedesign в трёх ключевых областях: инжиниринг антител, дизайн ферментов и открытие природных ферментов. Это решение критически важно для разработки новых терапевтических антител и ферментных препаратов, так как позволяет неэкспертам создавать сложные многокритериальные оптимизационные workflows. Открытый исходный код платформы и призыв к сообществу способствуют ускорению биомедицинских исследований.