EDPB запустил публичное обсуждение Руководства о скрейпинге веб-данных для генеративного ИИ: что нужно знать бизнесу
7 июля 2026 года Европейский совет по защите данных (EDPB) принял проект Руководства 03/2026 по скрейпингу веб-данных для генеративного ИИ, открытый для публичного обсуждения с 8 июля по 30 октября 2026 года, — специальный документ, посвященный практике, лежащей в основе значительной части крупномасштабного обучения ИИ: сбору данных из открытого интернета. Независимо от того, осуществляет ли компания скрейпинг самостоятельно, передает его на аутсорсинг или просто покупает готовый набор данных, проект Руководства в конкретных терминах определяет, как должно быть достигнуть соответствие требования европейского законодательства в данной части.
На кого распространяется действие Руководства
Руководство распространяется на организации частного сектора, которые собирают персональные данные из внешних источников для обучения или донастройки (fine-tuning) генеративных моделей ИИ — будь то собственными силами, через подрядчика или путем приобретения набора данных, уже собранного другой организацией. Из сферы применения исключены брокеры данных, которые лишь перепродают собранные наборы данных без обучения моделей, обработка организацией собственных данных, а также скрейпинг, осуществляемый органами государственной власти. Такие ситуации в целом остаются подчинены законодательству о защите данных, в том же время они находятся за рамками сферы применения данного документа.
Статус лица, осуществляющего скрейпинг, по GDPR
Субъект, осуществляющий скрейпинг, не становится автоматически контролером данных. Лицо, действующее на основании документированных инструкций разработчика ИИ, является обработчиком данных (processor), а контролером в свою очередь выступает разработчик. Если разработчик повторно использует набор данных, уже собранный другой организацией, каждая из сторон несет ответственность только за собственную обработку — первоначальный сборщик данных не отвечает за последующее использование данных. Совместный контроль (joint controllership) возникает, когда обе стороны совместно определяют цели и средства обработки, например совместно согласовывая критерии сбора данных для набора, который одна сторона будет формировать для обучения модели другой стороны.
Именно от этой классификации зависит, кто подписывает соглашение об обработке данных (data processing agreement), кто отвечает на запросы субъектов данных, и кто несет риск ответственности, если выяснится, что набор данных был собран незаконно.
Три ключевых принципа GDPR
Проект Руководства добавляет рекомендуемое EDPB толкование того, как каждый из основных принципов GDPR применяется к скрейпингу:
- Прозрачность: индивидуальное уведомление каждого субъекта данных часто невозможно или несоразмерно, и статья 14(5)(b) GDPR может освобождать от этой обязанности — но только после оценки соотношения числа затронутых субъектов данных, возраста и существующих гарантий. Даже в этом случае публичное уведомление является обязательным и должно соответствовать определенному перечню требований:
- подробное, изложенное простым языком уведомление о конфиденциальности (Privacy Notice), которое легко найти;
- максимально полное раскрытие источников — в идеале доступный для поиска перечень доменов и URL-адресов, с которых осуществлялся сбор данных с указанием дат такого сбора;
- категории собираемых данных, а также цели и правовые основания их обработки;
- действующий механизм, позволяющий физическим лицам реализовывать свои права субъекта данных.
- Минимизация данных: до начала скрейпинга - точные критерии сбора, картирование данных, фильтры, исключающие такие категории, как финансовые данные или данные о местоположении, исключение сайтов, структурно содержащих чувствительные данные, а также соблюдение robots.txt, ai.txt и CAPTCHA. Во время и после сбора - синтаксическая фильтрация, замена синтетическими данными, анонимизация или псевдонимизация.
- Точность: предпочтение надежным, поддерживаемым источникам, фиксация дат сбора данных и проверка данных перед обучением - это требование распространяется и на точность персональных данных, которые впоследствии выдает обученная модель.
Тест законного интереса
Согласие (consent) субъекта персональных данных редко применимо в случае скрейпинга веб-данных: прямая связь с физическим лицом отсутствует, а публикация данных в интернете не означает согласия на их повторное использование. Поэтому законный интерес по статье 6(1)(f) GDPR является основанием, на которое будет опираться большинство частных организаций, при условии соблюдения трех кумулятивных условий.
- Наличие подлинного, юридически обоснованного интереса — разработка или совершенствование модели ИИ может отвечать этому критерию, включая модель общего назначения, для которой конечное применение пока не определено.
- Необходимость - критерии сбора данных должны быть ограничены тем, что требуется для достижения цели; неизбирательный (бессистемный) сбор данных ослабляет обоснование, как и игнорирование менее интрузивных альтернатив, таких как синтетические или псевдонимизированные данные.
- Тест на соотношение интересов (balancing test) — сопоставление интереса контролера с правами субъекта данных с учетом чувствительности данных, масштаба и продолжительности сбора, а также того, насколько трудно физическому лицу возразить против обработки после того, как модель уже обучена.
- где и в каком контексте данные были первоначально опубликованы;
- насколько источник действительно является общедоступным (открытый блог отличается от форума, доступного только после входа в систему);
- устанавливает ли сайт технические барьеры для автоматизированного сбора данных, например robots.txt, ai.txt или CAPTCHA;
- мог ли субъект данных разумно ожидать, что его данные будут использованы для обучения модели ИИ, а не просто прочитаны другими людьми;
- особенности субъекта данных, например является ли он несовершеннолетним или публичной фигурой - сама статья 6(1)(f) GDPR особо выделяет интересы детей как имеющие повышенный вес при таком сопоставлении.
- Если баланс складывается не в пользу контролера, ситуацию могут исправить смягчающие меры: исключение по умолчанию контента с повышенным риском или доступного только после входа в систему, установление временных ограничений, публикация актуального перечня источников сбора данных, предоставление права на возражение или реестра отказа (opt-out), оперативное удаление или анонимизация данных, и защита от «запоминания» и воспроизведения данных моделью. Отсутствие любых из этих мер - как в случае с инструментом клонирования голоса, обученным без соответствующих гарантий, - полностью лишает возможности ссылаться на законный интерес.
Нюансы, касающиеся специальных категорий данных
Скрейпинг специальных категорий персональных данных - таких как расовое или этническое происхождение, политические взгляды или данные о состоянии здоровья - запрещен без применения исключения, предусмотренного статьей 9(2) GDPR. Поскольку при скрейпинге часто невозможно избежать таких данных, EDPB применяет подход Суда ЕС, сформулированный в деле GC and Others (C-136/17), изначально разработанный для поисковых систем: запрет, установленный статьей 9, обязывает контролера только в пределах его собственных обязанностей, полномочий и возможностей.
Это применимо только в тех случаях, когда обработка сходна по характеру с деятельностью поисковой системы, сбор данных специальных категорий носит случайный и непреднамеренный характер, его действительно затруднительно предотвратить заранее, а контролер внедрил гарантии на всех этапах жизненного цикла данных — предварительную фильтрацию до сбора, оперативное удаление после выявления, устойчивость к извлечению данных в процессе разработки модели и непрерывный мониторинг выходных данных после развертывания, при необходимости также следует рассмотреть возможность «машинного забывания» (model unlearning).
Рекомендации REVERA
- Определить источники данных и правовые основания до начала скрейпинга, а не постфактум - EDPB рассматривает минимизацию данных как обязанность, встроенную в архитектуру процесса (design obligation).
- Внедрять логику исключения, учитывающую сигналы robots.txt, ai.txt и CAPTCHA, и по умолчанию исключать сайты, известные тем, что содержат чувствительные данные или данные несовершеннолетних.
- Закреплять письменно распределение ролей контролера/обработчика/совместного контролера до привлечения подрядчика по скрейпингу или приобретения набора данных и отражать это распределение в соглашении об обработке данных.
- Подготовить публичное уведомление в соответствии со статьей 14, охватывающее источники, категории данных, характеристики поискового робота (crawler) и права субъектов данных, и поддерживать его в актуальном состоянии.
- Документировать анализ необходимости и теста на соотношение интересов по мере его проведения - принцип подотчетности по статье 5(2) означает необходимость демонстрировать именно ход рассуждений, а не только
- В случаях, когда специальные категории данных реально невозможно исключить, подтверждать наличие гарантий на всех этапах жизненного цикла - фильтры при сборе, оперативное удаление, тестирование на этапе обучения и мониторинг выходных данных, - а не ограничиваться единственной контрольной точкой.
В совокупности Руководство ставит под контроль GDPR весь жизненный цикл разработки ИИ — от выбора источников данных через их сбор и хранение до мер, предотвращающих воспроизведение обученной моделью запомненных персональных данных. Соблюдение требований лишь на одном из этапов этой цепочки не будет удовлетворять требованиям EDPB.
Поскольку статус контролера зависит от того, кто фактически определяет цели и средства обработки, в соглашениях с подрядчиками по скрейпингу и поставщиками наборов данных следует закреплять источники данных, критерии сбора и исключения, права на проведение аудита, а также гарантии в отношении того, как был сформирован приобретаемый набор данных. Поскольку первоначальный сборщик данных не несет ответственности за последующее использование данных разработчиком, именно договорная документация становится для разработчика основным доказательством соблюдения принципа подотчетности, если регулятор задаст вопрос о том, как был сформирован обучающий набор данных.
Сроки
Данное Руководство пока остается проектом. EDPB принял его 7 июля 2026 года для проведения публичных консультаций, а не в окончательном виде: оно не является самостоятельным нормативным актом, а представляет собой необязательные рекомендации Совета о том, как следует толковать и применять действующий GDPR к скрейпингу веб-данных, и текст может еще измениться до его окончательного утверждения.
Консультации продлятся с 8 июля по 30 октября 2026 года, комментарии подаются через онлайн-форму EDPB и, если не заявлен отказ (opt-out), публикуются с указанием имени заявителя, отрасли и страны. У компаний, столкнувшихся с противоречием между потребностью в масштабных обучающих данных и требованиями Руководства о минимизации данных и применении смягчающих мер, есть ограниченное время, чтобы поднять вопросы, связанные с практическим применением, до окончательного утверждения текста.
Практика Arbitration & IT Disputes консультирует разработчиков ИИ, подрядчиков по скрейпингу и компании, внедряющие инструменты генеративного ИИ, по вопросам соответствия источников данных требованиям GDPR, оценки законного интереса и теста на соотношение интересов, а также договорного структурирования отношений в цепочке «сборщик данных - разработчик - оператор».
Напишите нашему юристу, чтобы узнать подробности
Написать юристу