Статья посвящена проблеме оценки надежности предсказаний фундаментальных моделей для анализа одноклеточных данных (single-cell foundation models), которые все чаще применяются для предсказания типов клеток. Авторы отмечают, что на практике такие предсказания часто используются без оценки их достоверности или с применением простого порога к максимальной softmax-вероятности (MSP), что ставит вопрос: можно ли доверять сырым MSP-оценкам на новых (целевых) данных, отличающихся техническими и биологическими вариациями. Для ответа на этот вопрос предлагается система аудита, которая систематически сравнивает доверительные оценки, полученные на обучающем наборе (источнике), с реальностью целевого тестового набора. Исследование демонстрирует, что сырые MSP-оценки принципиально не отражают истинную уверенность при применении к целевым данным. Разлагая разрыв в доверии между источником и целью, авторы показывают, что расхождения возникают из-за комбинации ошибок ранжирования и систематического дрейфа вероятностей. Далее показано, что дрейф может быть успешно откалиброван с использованием небольшого подмножества размеченных целевых данных. Хотя такая перекалибровка повышает надежность автоматического принятия решений, она неизбежно вводит компромисс, увеличивая объем клеток, требующих ручной проверки. В итоге авторы утверждают, что безопасное развертывание этих моделей требует целевой корректировки доверительных оценок с использованием репрезентативных локальных меток.