В статье представлен SPHERE — новый метод, не основанный на моделях, который позволяет использовать чувствительные наборы данных (например, медицинские записи) в системах искусственного интеллекта и открытой науке, создавая их «синтетические двойники». Оригинальные данные при этом никогда не покидают локальную среду, что решает проблему конфиденциальности при совместном использовании данных. Метод был протестирован на 33 наборах данных из пяти научных областей, включая медицину и биологию. SPHERE точно воспроизводит статистические характеристики данных: средние значения, дисперсии и корреляции, а также обеспечивает численно идентичные эффекты и p-значения в линейном статистическом анализе. При этом сохраняется полезность данных для нелинейных методов машинного обучения, а генерация каждого «двойника» занимает секунды на обычном ноутбуке. Авторы демонстрируют, что ИИ-агенты, работающие с синтетическими двойниками, приходят к тем же научным выводам, что и при работе с оригинальными данными, включая воспроизведение результатов полногеномных и протеомных исследований в масштабе UK Biobank. Впервые открыто публикуется когорта Центра исследования болезни Альцгеймера Стэнфордского университета в виде SPHERE-двойника, охватывающего девять модальностей, доступная любому зарегистрированному исследователю без процедуры одобрения. Метод также применим к эмбеддингам глубокого обучения в области языка, зрения и временных рядов с минимальной потерей полезности. SPHERE выпускается с сертификацией конфиденциальности и точности каждого двойника, а также с ИИ-агентом, который автономно выполняет исследовательские задачи на чувствительных данных, не имея к ним прямого доступа. Это открывает возможность использовать закрытые наборы данных в открытой науке и ИИ для совершения ключевых открытий.