В статье исследователи провели масштабный анализ метаданных общедоступных данных секвенирования метагенома кишечника, хранящихся в NCBI Sequence Read Archive (SRA), с использованием Google BigQuery. Они сфокусировались на записях, относящихся к метагеному кишечника человека, мыши и широко аннотированным метагеномам кишечника. Оценены временной рост, глубина секвенирования, структура BioSample и BioProject, использование платформ и инструментов, полнота метаданных, атрибуция хозяина, связь с публикациями и исследовательские темы из связанной литературы. Обнаружено, что объем данных о микробиоме кишечника значительно увеличился со временем, с доминированием данных, связанных с человеком, и платформ Illumina. Технические метаданные были высоко полными, но биологический контекст (идентичность хозяина, фенотип, дизайн исследования, статус заболевания) часто был неполным или требовал восстановления из атрибутов BioSample и связанных публикаций. В общей когорте 'gut metagenome' идентичность хозяина была определена только для 13,00% BioSamples, что подчеркивает ограничения широких аннотаций организмов для автоматического формирования когорт. Связь с публикациями также была неполной на уровне архива, хотя для большинства связанных публикаций удалось восстановить полезный текст. Тематическое моделирование литературы, связанной с SRA, показало устойчивый акцент на составе основной микробиоты кишечника и растущее представление исследований когорт человека и микробиома младенцев. Авторы делают вывод, что общедоступные данные о микробиоме кишечника обширны и технически богаты, но не единообразно готовы к анализу. Улучшение гармонизации метаданных, связи с публикациями и восстановления биологического контекста необходимо для поддержки надежного крупномасштабного повторного использования и создания AI-ready ресурсов данных о микробиоме.