В статье представлен новый подход к интерпретации моделей белкового языка (pLM), таких как ESM-2, которые достигают высокой точности в предсказании эффектов мутаций без дополнительного обучения (zero-shot). Авторы предлагают фреймворк разреженных каузальных признаков, объединяющий разреженные автоэнкодеры, атрибуцию на основе интегрированных градиентов и активационное патчинг, чтобы выявить скрытые признаки, каузально опосредующие предсказания. Метод протестирован на 67 мутациях в J-домене белка DNAJA1, от сильно до слабо вредных, где предсказания ESM-2 хорошо согласуются с данными глубокого мутационного сканирования. Показано, что схемы, выбранные по косвенному эффекту, воспроизводят предсказания модели эффективнее и дают более информативные биологические объяснения, чем схемы, основанные на сырых изменениях активации, что указывает на то, что величина активации не всегда отражает каузальную важность. Обнаружено, что родственные замены используют значительную часть общих схем (от 40% до 75%), причем общие признаки часто представляют остатки, находящиеся в трехмерном контакте с сайтом мутации. Работа впервые предоставляет каузальное объяснение на уровне признаков для zero-shot предсказания эффектов мутаций в pLM, что важно для понимания и доверия к таким моделям в биомедицинских приложениях.