Исследование оценивает способность ведущих LLM (включая Gemini и Grok) отвечать на вопросы пациентов о заболеваниях сердца. Результаты показали высокую точность и низкий уровень галлюцинаций, при этом Gemini была признана наиболее качественной моделью по совокупности факторов.
Статья, опубликованная в журнале npj Artificial Intelligence 8 сентября 2026 года, исследует влияние выбора шкалы оценивания на качество работы LLM-судьи (LLM-as-a-judge) — подхода, при котором большая языковая модель используется для автоматической оценки ответов других моделей. Авторы провели систематическое сравнение нескольких распространённых шкал (0–5, 0–10, 0–100 и другие) на наборе задач из медицинской и общей областей. Ключевой результат: согласованность оценок LLM с оценками экспертов-людей оказалась максимальной при использовании шкалы 0–5, тогда как более дробные шкалы приводили к снижению точности и увеличению разброса. Исследование также показало, что на шкале 0–5 LLM-судья демонстрировал меньшую склонность к предвзятости по длине ответа и лучше различал качественные ответы. Работа имеет прямое практическое значение для разработки систем автоматической оценки в медицинских приложениях, где точность и воспроизводимость оценок критически важны, например, при валидации ответов диагностических ассистентов или оценке качества клинических рекомендаций, сгенерированных ИИ.