Москва6 авгВести.В России разработали предварительный национальный стандарт для синтетических данных — искусственно сгенерированной информации, которая воспроизводит реальные данные без сведений о конкретных людях. Документ должен упростить обучение ИИ-моделей и обмен данными между компаниями и ведомствами, с его копией ознакомились в РБК.
Синтетические данные используют для обучения искусственного интеллекта, тестирования моделей машинного обучения, обмена данными с контрагентами и обогащения существующих массивов. До сих пор в России не было единых требований к созданию и качеству таких данных.
Ассоциация больших данных (включает "Яндекс", VK, "Сбер", Т-банк, МТС и др.) совместно с АНО "Национальный технологический центр цифровой криптографии" вели работу над стандартом с начала 2025 года. В ассоциации подчеркивают, что без него невозможно обучать суверенные ИИ-модели. Качественные синтетические данные, созданные по стандарту, теряют связь с исходной персональной информацией.
Это позволит использовать большой объем данных, которые раньше оставались недоступными из-за своей чувствительности, заменяя их легально доступными синтетическими аналогами
рассказал представитель Ассоциации больших данных
Документ объединил нейросетевые методы синтеза, техники управления приватностью и метрики качества. Действие предварительного стандарта рассчитано на три года, после чего он может стать полноценным ГОСТом, либо быть пересмотрен или отменен. Представители "Ростелекома", "МегаФона" и Сбербанка поддержали инициативу, отметив, что стандарт снизит риски утечек и неопределенность при использовании данных, а также ускорит внедрение ИИ-решений в государственном и корпоративном секторах.
За рубежом единого стандарта пока нет — работы ведутся в Международной организации по стандартизации (ISO), Международной электротехнической комиссии (IEC) и Институте инженеров электротехники и электроники (IEEE), а отдельные страны имеют собственные рекомендации.
Однако российский документ, по оценке разработчиков, уже сейчас находится на передовом уровне благодаря комплексному подходу, объединяющему передовые математические методы и прикладные требования. Впереди — трехлетний этап апробации, в ходе которого стандарт будет дорабатываться с учетом отраслевого опыта, чтобы в итоге стать полноценным ГОСТом, обязательным для всей страны.








