Исследование представляет фреймворк для аудита предвзятости алгоритмов в клинической поддержке принятия решений с использованием логов прослеживаемости данных. Авторы сравнивают логистическую регрессию и случайный лес, доказывая, что интерпретируемость модели не всегда гарантирует отсутствие дискриминации, и предлагают стандарт записи для соответствия требованиям FDA и ONC.
Статья посвящена проблеме оценки надежности предсказаний фундаментальных моделей для анализа одноклеточных данных (single-cell foundation models), которые все чаще применяются для предсказания типов клеток. Авторы отмечают, что на практике такие предсказания часто используются без оценки их достоверности или с применением простого порога к максимальной softmax-вероятности (MSP), что ставит вопрос: можно ли доверять сырым MSP-оценкам на новых (целевых) данных, отличающихся техническими и биологическими вариациями. Для ответа на этот вопрос предлагается система аудита, которая систематически сравнивает доверительные оценки, полученные на обучающем наборе (источнике), с реальностью целевого тестового набора. Исследование демонстрирует, что сырые MSP-оценки принципиально не отражают истинную уверенность при применении к целевым данным. Разлагая разрыв в доверии между источником и целью, авторы показывают, что расхождения возникают из-за комбинации ошибок ранжирования и систематического дрейфа вероятностей. Далее показано, что дрейф может быть успешно откалиброван с использованием небольшого подмножества размеченных целевых данных. Хотя такая перекалибровка повышает надежность автоматического принятия решений, она неизбежно вводит компромисс, увеличивая объем клеток, требующих ручной проверки. В итоге авторы утверждают, что безопасное развертывание этих моделей требует целевой корректировки доверительных оценок с использованием репрезентативных локальных меток.
Статья представляет BloClaw — рабочую станцию для научных исследований с искусственным интеллектом (AI4S), предназначенную для аудируемой вычислительной биологии. Основной принцип системы: научный агент должен знать, что он может делать, показывать, как он это сделал, и указывать, что осталось непроверенным. Каждая функциональная возможность описывает состояние выполнения, ограничения входных данных, зависимости, ожидаемые результаты и научные ограничения. Запросы на естественном языке преобразуются в структурированные задачи, проверяются на соответствие реестру возможностей, выполняются с помощью научных инструментов и записываются в журнал Living Lab Notebook с отслеживанием происхождения данных. Система обнаруживает недопустимые входные данные, сбои вызовов инструментов, отсутствующие зависимости и тайм-ауты, направляя их на исправление, повторную попытку или эскалацию. Реализованный и протестированный функционал включает скрининг молекулярных свойств и правил на основе RDKit, анализ структуры белков, проверку поз докинга, 3D-визуализацию и структурированную отчетность. Демонстрация на структуре осимертиниба из PubChem и артефакте докинга 6LU7 показала детерминированные дескрипторы (молекулярная масса 499.619 Да, cLogP 4.5098, TPSA 87.55 Ų) и 2387 записей атомов белка, 309 остатков и девять записей поз. Авторы подчеркивают, что это демонстрация рабочего процесса, а не исследование эффективности или сродства. Также описана предлагаемая конструктивная модель с минимизацией априорных предположений, где целевая функция компилируется в физические, химические и системные ограничения, а наблюдения используются для калибровки и фальсификации. Описан протокол оценки, сравнивающий BloClaw со стандартным однопроцессным агентом и фиксированными скриптами по полноте задач, научной корректности, успешности восстановления, полноте происхождения, воспроизводимости, времени рецензирования, задержке и стоимости. Система позиционируется как уровень исполнения и подотчетности для ИИ-ассистированных исследований, дополняющий экспертный анализ и экспериментальную валидацию.