В статье представлен критический самоаудит графовой нейронной сети MetaGNN, предназначенной для оценки активности метаболических реакций в контексте персонализированного моделирования рака. Авторы выявили два независимых механизма, которые приводили к завышенным результатам бенчмарков. Во-первых, при обучении с метками, полученными пороговым преобразованием тех же транскриптомных данных, которые подаются на вход модели, достигался AUROC 0.9864 на TCGA-BRCA, однако это объяснялось прямой утечкой меток: для 5,925 реакций метки были детерминированной функцией входа, а для 4,675 реакций метки были сгенерированы псевдослучайным генератором с фиксированным сидом, и модель запоминала инвариантный вектор меток. Во-вторых, в независимом когорте модели, обученные без данных пациентов, имели нулевые признаки и не показывали согласия между пациентами, что указывает на отсутствие реального сигнала. После исправления этих проблем и переобучения на валидных признаках AUROC упал до 0.5800, что ниже базовых показателей (0.6342 для сырых данных и 0.6085 для информационно-пустого индикатора). Перенос модели на другие датасеты (METABRIC, CPTAC) оказался на уровне случайности. Авторы отзывают ранее заявленное улучшение на 0.105 AUROC от реляционных рёбер и публикуют код, данные и скрипты для воспроизведения проверок. Работа подчёркивает важность строгой валидации бенчмарков в ИИ-медицине и предлагает практические рекомендации для предотвращения утечки данных.