В статье представлен Karenina — открытый фреймворк, предназначенный для многомерной оценки языковых моделей и агентов в биомедицине. Авторы отмечают, что современные бенчмарки вознаграждают правильные ответы, даже если лежащие в их основе рассуждения ошибочны, что создает риски для клинического применения. Karenina преобразует экспертные знания в структурированные оценки по нескольким измерениям, охватывающим вопросы, многоходовые диалоги и автономный анализ данных. Фреймворк выходит за рамки простого скоринга, обеспечивая более глубокую проверку надежности и обоснованности решений ИИ. Это позволяет принимать более безопасные и обоснованные решения при использовании ИИ в биомедицинских задачах. Код и документация доступны как open-source, что способствует воспроизводимости и широкому внедрению. Работа адресована исследователям и разработчикам, стремящимся к более строгой и прозрачной оценке ИИ в медицине.