В статье исследуется проблема систематической ошибки (bias) в моделях компьютерного зрения, оценивающих индекс массы тела (ИМТ) по фотографиям лиц. Такие модели предлагают неинвазивную и недорогую альтернативу физическим измерениям, что полезно для телемедицины, неотложной помощи, автоматического самоконтроля и крупномасштабных эпидемиологических исследований. Однако большинство существующих моделей обучаются на правительственных записях, изображениях из социальных сетей и фотографиях знаменитостей, что приводит к смещению выборки и неспособности представлять широкую общественность. Авторы обучили и оценили модели Vision Transformer (ViT-H/14) на парных данных ИМТ и фотографий лиц из четырех коренных популяций: оранг-асли (Малайзия), джу/'хоанси (Южная Африка), сама (Филиппины) и цимане (Боливия). Были сравнены четыре стратегии обучения: от моделей, обученных на одной популяции (фокальные модели), до моделей, обученных на полном объединенном глобальном наборе данных (глобальные модели). Результаты показали, что обучение на данных целевой популяции всегда дает наилучшую точность. Однако когда целевая популяция отличается от обучающей выборки, добавление большего разнообразия в обучение улучшает предсказания для невидимых популяций. Таким образом, обучение на собственных данных популяции оптимально, если такие данные существуют, а обучение на данных, охватывающих широкий спектр морфологии человека, является лучшей альтернативой в противном случае. Эти выводы подчеркивают важность разнообразия обучающих данных для разработки надежных инструментов машинного обучения в здравоохранении, которые могут обобщаться на разные человеческие популяции.