Исследование посвящено критической проблеме в анализе данных секвенирования следующего поколения (NGS), таких как микробиомные исследования, RNA-seq и метагеномика. Авторы доказывают, что использование арифметического среднего (AM) для обобщения относительных пропорций приводит к нестабильному ранжированию признаков, которое меняется в зависимости от выбранного метода нормализации. В ходе тестирования на наборе данных dietswap (n=38) было обнаружено, что у 22,5% распространенных родов бактерий (включая Bacteroides и Eubacterium) выводы о значимости групп радикально различались при использовании AM и геометрического среднего (GM). Исследование демонстрирует, что GM-ранжирование инвариантно к мультипликативной структуре композиционных данных, а использование трансформации центрированного логарифмического отношения (CLR) математически эквивалентно применению GM. Авторы рекомендуют использовать геометрическое усреднение для ранжирования признаков и CLR-трансформацию для межгрупповых сравнений, что позволяет устранить скрытый источник невоспроизводимости при поиске биомаркеров в метагеномике, транскриптомике и метаболомике. Данный подход не требует новых вычислительных инструментов и полностью совместим с существующими конвейерами анализа дифференциальной экспрессии.