Бигтех хочет учить нейросети на ваших данных без спроса. Это часть невидимого и очень опасного цензурного механизма. Разбор #29

На примере ИИ-законов мы видим еще один вариант цензуры — просто не особо заметный.
Что это за рубрика

В рубрике «Разбор Теплицы» мы в режиме реального времени разбираемся в определённой проблеме, новостях интернет-цензуры и рассказываем:

  • что происходит;
  • как это устроено;
  • как с этим можно бороться.

«Сбер», «Яндекс», VK, «Ростелеком», «Авито» и HH попросили Минцифры разрешить обучать ИИ на обезличенных данных россиян без их согласия. Разбираемся, что закон позволяет уже сейчас, чего не хватает бизнесу и почему в ту же неделю те же компании утвердили стандарты, которые делают эту просьбу необязательной. Этот материал продолжает тему Разбора №15 про закон о регулировании ИИ. Там речь шла прежде всего о том, кто получит статус «национальной» модели. Здесь о том, на чём эти модели будут учиться.

Кратко

  • Что случилось?
    Ассоциация больших данных 3 августа 2026 года направила в Минцифры обращение с просьбой разрешить обрабатывать обезличенные персональные данные без согласия граждан для разработки и обучения ИИ.
  • Кто просит?
    В ассоциацию входят «Авито», «Сбер», «Ростелеком», «Яндекс», HH и VK.
  • Что уже можно?
    С 1 сентября 2025 года обезличенные данные разрешено обрабатывать без согласия. Работает государственная система, куда операторы обязаны бесплатно отдавать такие данные по требованию Минцифры.
  • Чего хотят дополнительно?
    Вывести данные, обработанные технологиями защиты приватности, из режима персональных полностью. Плюс ввести «доверенного посредника» с государственной аккредитацией и разделить данные на платные и бесплатные.
  • Главный поворот?
    В тот же день, 6 августа, та же ассоциация сообщила об утверждении государственных стандартов на синтетические данные. По оценке «Сбера», модели на синтетике теряют 2-3% точности против моделей на реальных данных.
  • Где документ?
    Его пока нет. Само обращение не опубликовано, о его содержании известно со слов «Коммерсанта».

Что происходит

6 августа «Коммерсантъ» сообщил об обращении Ассоциации больших данных в Минцифры. Письмо датировано 3 августа, издание с ним ознакомилось, в открытый доступ документ не попал. В министерстве на запрос газеты не ответили.

Ассоциация просит разрешить обрабатывать данные с применением технологий повышения приватности без согласия граждан, если соблюдены три условия: риск установить личность равен нулю или составляет малые доли процента, данные идут только на разработку и обучение ИИ, обработка ведётся российскими компаниями на территории страны.

Технологии повышения приватности, они же PETs — набор математических и программных методов, которые позволяют обрабатывать данные, не раскрывая исходную информацию о людях. Аргумент ассоциации сводится к тому, что закон не выделяет их в отдельную категорию: любое алгоритмическое преобразование данных считается обезличиванием, поэтому зрелые методы защиты юридически приравнены к слабым.

Ассоциация предлагает и организационную надстройку в виде «доверенного посредника» с аккредитацией госорганов, который держит информационную систему для хранения обезличенных данных и доступа к ним. Данные предлагается разделить на две категории, платную и бесплатную.

При этом кто конкретно получит доступ к этим массивам, в ассоциации не уточнили.

Что закон разрешает уже сейчас

Что закон разрешает уже сейчас

Формулировка «просят упростить» создает впечатление, будто обезличенные данные сегодня под запретом. Это не так. Федеральный закон № 233-ФЗ от 8 августа 2024 года дополнил закон о персональных данных статьей 13.1, которая ввела понятия «обезличенные персональные данные» и «состав обезличенных данных». С этого момента обрабатывать такие данные без согласия человека разрешено, в том числе для обучения ИИ. Запрет остался только на использование их для рекламы, продвижения товаров и политической агитации.

Методы обезличивания задал приказ Роскомнадзора № 140 от 19 июня 2025 года: введение идентификаторов, изменение состава, декомпозиция, перемешивание. Убрать имя и телефон недостаточно, оператор обязан обеспечить невозможность восстановить личность даже по косвенным признакам.

Одновременно появилась государственная система, куда стекаются такие массивы. Она построена на Единой платформе национальной системы управления данными, а в отрасли её зовут «госозером». Минцифры вправе направить любому оператору персональных данных требование обезличить сведения и передать их туда, причём бесплатно.

Бизнес хочет, чтобы данные, прошедшие через технологии защиты приватности, перестали считаться персональными вообще, со всеми обязанностями оператора и правами человека, которые из этого статуса следуют. Государству операторы отдают обезличенные массивы даром по требованию. Между собой предлагают торговать, разделив данные на платные и бесплатные.

А почему это цензура

Цензура давно перестала сводиться к запрету. В других разброрах мы смотрели, как она работает через реестры допущенного, через плату за право связаться, через требование раскрыть себя. На примере ИИ-законов мы видим еще один вариант цензуры — просто не особо заметный.

Модель это фильтр

Нейросеть отвечает исходя из того, что было в обучающей выборке. Чего в данных не оказалось, того для модели не существует. Когда человек спрашивает у ассистента про события, законы или организации, он получает не поиск по интернету, а пересказ выборки. Кто определил ее состав, тот определил и границы ответа. Собственно, это стало одной из базовых проблем созданных в Китае нейросетей, которые неохотно или вообще не отвечают на вопросы про разные неприятные события в истории КНР.

Состав выборки закрыт

Реестр заблокированных сайтов хотя бы существует как перечень: его можно скачать, проверить, оспорить конкретную запись. Обойти блокировки, наконец. Здесь перечня нет. Что попало в государственную систему обезличенных данных и что оттуда выдают, публично неизвестно. Проверить, чего в выборке не хватает, невозможно в принципе, потому что отсутствие не оставляет следа.

Допуск распределяется административно

Предложение о «доверенном посреднике» с государственной аккредитацией повторяет конструкцию, которую мы видели в реестре социально значимых сервисов и в реестре доверенных виртуальных АТС. Появляется список тех, кому можно. Сначала распределяли доступ в интернет и право звонить. Теперь распределяют сырьё, из которого делают машины, отвечающие на вопросы.

Контур с двух сторон

В Разборе №15 мы изучали закон, по которому модели проверяют на соответствие «традиционным ценностям», а экспертизу поручают организациям с государственной аккредитацией. Это контроль выхода: что модели разрешено говорить. Нынешнее обращение достраивает вход: на чем вообще позволено учить российский ИИ. Между этими двумя точками не остается места, где содержание определяется чем-то, кроме административного решения.

Согласие человека в этой конструкции было последней точкой, где он хоть формально участвовал в решении. И вот похоже что и ее не будет.

Любопытное совпадение

Пока «Коммерсантъ» готовил публикацию, Ассоциация больших данных сообщила об утверждении первой в России серию национальных стандартов по синтезу данных. Документы вступают в силу 1 сентября 2026 года. Новость пришла в «Коммерсантъ» одновременно с запросом бигтеха в минцифры

Синтетические данные генерируют так, чтобы они повторяли статистические свойства настоящих, но не относились ни к одному живому человеку. Исполнительный директор ассоциации Алексей Нейман в том же сообщении говорит, что такой подход позволяет развивать сервисы «без избыточного вовлечения реальных персональных данных».

Как все в итоге выглядит. Публично ассоциация радуется стандартам синтетических данных. Непублично — хочет учить ИИ на реальных людях.

Цена вопроса

Кто и что говорит

Министерство пока молчит Отраслевые эксперты считают, что у бигтеха в России дефицит данных — вот Ассоциация и пишет письма в правительство. Так, партнер Zarya Ventures Александр Пономарев отмечает, что рынок данных в России развит слабо, а большинство наборов заперто внутри крупных экосистем. А представительница Just AI Светлана Захарова добавляет, что компании исчерпали собственные источники и ищут новые.

Где-то мы это уже встречали

В Разборе №24 про маркировку звонков та же Ассоциация больших данных предлагала создать реестр доверенных виртуальных АТС. Владелец вносит свои адреса после авторизации через «Госуслуги», а операторы принимают голосовой трафик только с адресов из реестра.

И снова та же схема: бизнес создает посредника под наблюдением государства и чужих к данным не подпускает.

Отдельно отметим, что в Разборе №15 мы разбирали критерии «национальной» модели, под которые, по оценке экспертов, подходят только крупные экосистемные игроки. Те же компании теперь просят доступ к данным граждан. 

Международная практика 

Вопрос «можно ли учить нейросеть на данных людей, не спрашивая их» — одна из главных тем споров последних пяти лет. Например, в декабре 2024 года Европейский совет по защите данных по запросу ирландского регулятора заявил: законный интерес годится как основание для разработки и работы ИИ-моделей.

Но обычно схема на стороне клиента. Компания обязана провести и задокументировать оценку законного интереса, а человек сохраняет право возразить против обработки. Дальше приходит регулятор и проверяет, была ли оценка честной. Аналитики Международной ассоциации специалистов по приватности подсчитали, что оборот «в каждом случае отдельно» встречается в документе шестнадцать раз, а слова «может» и «возможно» сто шестьдесят один раз. Регулятор буквально дует на воду, еще не обжегшись на молоке.

В США федерального закона о персональных данных нет, вопрос закрывают отраслевые нормы, законы отдельных штатов и практика торговой комиссии. Единого ответа там тоже не выработано. Не то чтобы всем все равно — каждый штат выкручивается как умеет.

Российский бигтех хочет избежать проверок при каждом соприкосновением с данными людей.

Что это значит для людей

Практических последствий у инициативы, если её примут, несколько.

  • Мы больше не будем контролировать нейросети в РФ. Сейчас человек хотя бы формально решает, что происходит с его данными до обезличивания. Предложение убирает эту точку для целей обучения ИИ.
  • Категория «уже не персональные данные» в России расширяется. Вместе со статусом уходят обязанности оператора: уведомлять, обеспечивать доступ, удалять по требованию.

Для НКО и независимых проектов есть отдельный поворот. Ваши данные тоже лежат в этих экосистемах: почта, объявления, банк, поиск, резюме. Если режим допуска смягчат, они попадут в обучающие выборки без отдельного разговора с вами. Оценить это заранее нельзя, потому что состав массивов не публикуется.

Вторая сторона, о которой мы уже говорили выше — нейросети российского бигтеха смогут выдавать только удобную властям информацию и расширять цензуру.

Что можно сделать

Полностью выйти из этого контура не получится, экосистемы охватывают базовые сервисы. Но кое-что в ваших руках.

Проверьте и отзовите лишние согласия там, где они есть. Пока данные не обезличены, согласие работает, и его отзыв ограничивает дальнейшую обработку.

Разносите активность между сервисами. Чем меньше ваша жизнь собрана в одной экосистеме, тем беднее профиль, который из неё извлекается.

Следите за общественным обсуждением. Обращение ассоциации это пока просьба, а не норма. Если Минцифры вынесет проект на портал нормативных актов, там открывается формальная возможность высказаться, и она иногда работает.

Организациям стоит посмотреть на свою сторону этого же вопроса. Если вы обрабатываете данные людей, требование Минцифры обезличить их и передать в государственную систему касается вас с сентября 2025 года. Проверьте, готовы ли вы к такому запросу и понимаете ли, что именно уйдёт.

Что делать разработчикам 

Если вы работаете с данными людей или обучаете на них модели, часть обязанностей возникла у вас ещё год назад, независимо от судьбы этого обращения.

Проверьте, готовы ли вы к требованию от министерства. С сентября 2025 года Минцифры вправе направить любому оператору персональных данных требование обезличить сведения и бесплатно передать их в государственную систему. Стоит заранее понять, какие ваши массивы под это попадают и что именно уйдёт.

Не путайте удаление имени с обезличиванием. Приказ Роскомнадзора № 140 задаёт конкретные методы: введение идентификаторов, изменение состава, декомпозиция, перемешивание. Проверяется не название метода, а результат: человека не должно быть видно даже по косвенным признакам. Дата рождения плюс город плюс профессия опознают человека не хуже паспорта.

Ведите происхождение наборов данных. Для каждого датасета фиксируйте источник, основание обработки и ограничения по использованию. Пока регулирование меняется каждые несколько месяцев, это единственный способ быстро оценить свои риски, не поднимая архив вручную.

Разделяйте в архитектуре исходные данные и производные. Эмбеддинги, агрегаты и веса модели должны храниться отдельно от сырых записей. Если всё лежит вперемешку, доказать обезличенность вы не сможете.

Тестируйте модель на запоминание. Крупные модели умеют воспроизводить куски обучающей выборки дословно. Если из вашей модели извлекается фрагмент исходных данных, обезличенность рушится вместе с юридическим основанием. Проверка на извлечение обучающих данных должна стоять в регулярных тестах, а не в списке пожеланий.

Посмотрите на синтетику как на рабочий инструмент. С 1 сентября 2026 года действуют национальные стандарты ПНСТ 1064-2026, 1065-2026 и 1066-2026, и теперь на них можно ссылаться в документации. По оценке участников рынка потеря точности составляет 2-3%, а юридических вопросов к синтетическим наборам заметно меньше.

Помните про ограничение цели. Обезличенные данные разрешено использовать для аналитики и обучения моделей, но запрещено для рекламы, продвижения товаров и политической агитации. Если продукт про маркетинг, эта дорога закрыта независимо от качества обезличивания.

Собирайте меньше. Совет звучит скучно, но он единственный, который работает при любом развитии регулирования. Данных, которых вы не собрали, у вас не потребуют, они не утекут и не попадут в чужую обучающую выборку. Для проектов, работающих с уязвимыми людьми, это главное архитектурное решение, и принимается оно в самом начале, а не после первого запроса.

Источники

Первоисточники и официальные публикации

Публикации о самом обращении

  • «Коммерсантъ», «Без права на несогласие», 6 августа 2026 года. Газета №141, страница 5, автор Алексей Жабин. Содержание письма, три условия, предложение о «доверенном посреднике», комментарии Александра Пономарёва, Светланы Захаровой и Владимира Арлазарова, цитата Максута Шадаева с Петербургского форума. Само обращение не опубликовано, издание с ним ознакомилось.
  • CNews, «Сбербанк», «Авито», VK и «Яндекс» просят доступ к данным россиян. Состав получателей доступа ассоциация не раскрыла.

Правовая база

Международная практика

Наши предыдущие материалы