В статье представлено крупнейшее на сегодняшний день систематическое сравнение 63 инструментов автоматической аннотации типов клеток в данных одноклеточной РНК-секвенирования (scRNA-seq), охватывающее семь парадигм: маркерные, корреляционные, классическое машинное обучение, глубокое обучение, полу-контролируемые методы, большие языковые модели (LLM) и трансформерные фундаментальные модели. Авторы использовали ортогональный массив Тагучи L9(34), который позволяет независимо варьировать четыре свойства набора данных (количество клеток, дисбаланс классов, число типов клеток и силу дифференциальной экспрессии), что впервые дает возможность причинно связать производительность с характеристиками данных, а не с их случайной комбинацией. Бенчмарк проводился в пять фаз: полностью контролируемая симуляция, валидация на реальных данных в пределах и между платформами, аннотация с использованием баз данных и LLM с оценкой по онтологиям, а также точная настройка фундаментальных моделей. Используя стандартизированные входные данные (oracle inputs) и метрику Коэна (kappa), авторы обнаружили, что в протестированных диапазонах основные парадигмы достигают сопоставимой точности. Ключевой результат: точность предсказывается почти линейно по разделимости типов клеток в общем пространстве экспрессии, измеряемой как чистота k-ближайших соседей (kNN purity), и это соотношение сохраняется на разных платформах и после точной настройки фундаментальных моделей. Основная доля дисперсии kappa объясняется структурой данных, а не выбором конкретного инструмента. Вычислительная стоимость коррелирует с доступностью рабочего процесса, а не с точностью: доступные корреляционные и LLM-методы показали конкурентоспособные результаты, тогда как фундаментальные модели достигают их только после точной настройки. Авторы делают вывод, что ближайший прогресс в области лежит в укреплении инфраструктуры — повышении доступности инструментов, стандартизации оценки и устойчивости к вариациям конвейера, а не в разработке новых алгоритмов.