В исследовании представлен MolMAE — инновационная модель мультимодального маскированного автоэнкодера, предназначенная для глубокого обучения представлениям молекул. В отличие от традиционных подходов, опирающихся только на SMILES или 2D-графы, MolMAE интегрирует три типа данных: облака точек молекулярной поверхности, трехмерные графы молекул и токены фрагментов/функциональных групп из SMILES. Методология основана на совместном маскировании химически соответствующих локальных регионов во всех модальностях, что заставляет модель восстанавливать геометрию, топологию и семантику молекулы одновременно. Помимо реконструкции геометрии поверхности, модель обучается предсказывать физико-химические поля, включая электростатический потенциал и дескрипторы Фукуи. Предварительное обучение проводилось на массиве из 261 000 биологически активных молекул (lead-like). Результаты тестов на бенчмарке ESOL (при использовании scaffold splitting) показали превосходную точность, что подтверждает эффективность использования поверхностных данных для задач предсказания свойств, зависящих от взаимодействия лиганда с белком.