В статье представлен новый бенчмарк для оценки инструментов приоритизации генов при редких заболеваниях, решающий проблему циклической валидации. Проблема в том, что бенчмарки собираются из опубликованных клинических случаев, которые часто используются и для построения самих курируемых инструментов, что приводит к завышенным оценкам. Авторы выпускают стратифицированный набор из 1 047 случаев редких заболеваний из GA4GH Phenopacket Store v0.1.26. Каждый случай содержит профиль фенотипа (Human Phenotype Ontology) и список из 50 генов-кандидатов (один причинный ген и 49 отвлекающих), а также метку причинного гена. Набор стратифицирован по четырем операционным категориям заболеваний на основе MONDO и выпущен в двух вариантах: со случайными отвлекающими генами и с фенотипически похожими отвлекающими генами, выбранными по сходству Resnik в HPO. Для более честной оценки добавлены два уровня метаданных: флаг, указывающий, цитируется ли публикация источника случая в файле аннотаций заболеваний HPO (определяющий подмножество без перекрытия, n = 282), и страты по давности публикаций. Также описан детерминированный рецепт с фиксированной версией для гибридного плотно-разреженного поискового индекса по примерно 2,25 миллионам статей PMC Open Access (52 777 395 чанков). Ресурс не содержит сравнений инструментов, но предоставляет инфраструктуру для объективной оценки.