Виртуальное окрашивание (virtual staining) — перспективный метод, позволяющий заменить дорогостоящую флуоресцентную микроскопию на дешёвую label-free микроскопию с последующей генерацией окрашенных изображений с помощью нейросетей. Однако его практическое применение зависит от способности моделей к обобщению на новые данные. В данном исследовании авторы систематически проверили, насколько семь широко используемых метрик оценки качества изображений (IQA) — MAE, PSNR, SSIM, foreground PSNR и SSIM, LPIPS и DISTS — пригодны для оценки виртуального окрашивания. Они применили контролируемые деградации (изменение интенсивности, текстуры, морфологии) к изображениям Cell Painting, охватывающим 18 клеточных линий, различные плотности посева и флуоресцентные каналы. Оказалось, что канал, клеточная линия и плотность посева объясняют значительную часть вариаций метрик даже после учёта степени деградации. Метрики DISTS и foreground-метрики показали лучший баланс между чувствительностью к деградации и инвариантностью к биологическому контексту, однако ни одна метрика не была полностью независима от биологических условий. При постепенном ухудшении изображений большинство метрик использовали лишь малую часть своего номинального диапазона значений и часто выходили на плато, тогда как визуальное качество продолжало падать. Далее авторы обучили три популярные архитектуры (UNet, WGAN-GP, UNeXt) на пяти плотностях посева клеток U2-OS и оценили их предсказания на 17 ранее не встречавшихся клеточных линиях. Архитектура и плотность посева вместе объясняли менее 2% вариаций метрик, а визуальный анализ показал, что одинаковые значения метрик могут соответствовать качественно разным ошибкам (например, различиям в морфологии клеток и интенсивности маркеров). Авторы делают вывод, что традиционные IQA-метрики плохо переносятся на задачи виртуального окрашивания, и рекомендуют выбирать и оптимизировать модели, ориентируясь на конкретное приложение, например, на высокопроизводительный скрининг лекарств без меток.