В исследовании оценивалась способность больших языковых моделей (GPT-4.1, Claude, Gemini) автоматически определять временные изменения (новые, улучшенные, ухудшенные, стабильные, разрешенные находки) в последовательных отчетах рентгенографии грудной клетки. На наборе данных LUNGUAGE (1500 примеров) лучший результат показала модель GPT-4.1 с few-shot стратегией промптов: точность 0.8369, макро-F1 0.7888. Авторы делают вывод, что LLM перспективны для временных клинических рассуждений, а эффективность зависит от архитектуры модели и стратегии промптов.