В статье, опубликованной в журнале Nature Machine Intelligence 3 сентября 2026 года, представлена модель NucleicBERT, разработанная группой Upadhyay и коллег. Модель обучена методом самоконтролируемого языкового моделирования на крупномасштабных данных РНК-последовательностей. Основная проблема, которую решают авторы, — сложность вывода структуры и функции РНК из-за нехватки аннотированных данных, несмотря на обилие самих последовательностей. NucleicBERT позволяет извлекать биологически значимые паттерны из корреляций последовательностей без явных аннотаций. Такой подход относится к применению методов обработки естественного языка (NLP) в биоинформатике и молекулярной биологии, что является частью более широкого направления ИИ в медицине. Модель может быть полезна для предсказания функций некодирующих РНК, что имеет значение для диагностики и терапии. Работа демонстрирует потенциал самоконтролируемого обучения для анализа биологических последовательностей и открывает новые возможности для интерпретации РНК-пространства.