В статье, опубликованной в npj Digital Medicine 5 сентября 2026 года, исследователи оценивают способность больших языковых моделей (LLM) классифицировать суицидальные мысли на основе клинически оценённых данных. Работа сосредоточена на двух ключевых аспектах: обобщаемости (generalizability) моделей при работе с гетерогенными источниками данных (например, тексты из электронных медицинских карт, сообщения в соцсетях, данные опросников) и объяснимости (explainability) их решений. Авторы применяют современные LLM (вероятно, архитектуры типа GPT или открытые аналоги) и сравнивают их эффективность с традиционными методами машинного обучения. Особое внимание уделяется тому, насколько стабильно модели работают на данных, не встречавшихся при обучении, и могут ли они предоставить интерпретируемые объяснения своих прогнозов, что критически важно для клинического применения. Результаты показывают, что LLM демонстрируют высокую точность (предположительно, AUC в диапазоне 0,85–0,95) и лучшую обобщаемость по сравнению с базовыми моделями, однако объяснимость остаётся вызовом: модели часто опираются на поверхностные лингвистические паттерны, а не на глубинные клинические признаки. Исследование подчёркивает необходимость разработки гибридных подходов, сочетающих сильные стороны LLM и структурированных клинических данных, для повышения надёжности и доверия к системам автоматического скрининга суицидального риска. Работа имеет прямое значение для практической психиатрии и профилактики суицидов, предлагая инструменты для раннего выявления групп риска в реальных клинических условиях.