На первый взгляд может показаться, что обучать ИИ на открытых данных — беспроигрышный вариант. В самом деле — тексты и изображения лежат в свободном доступе, то есть и результат принадлежит тому, кто обучил модель. На практике за этой простотой скрывается сразу несколько правовых ловушек. Рассмотрим, какие риски с ними связаны и почему общедоступное не равно ничье.
Ловушка непрозрачности
Прежде чем рассуждать о том, кто и как отвечает за обучение ИИ на чужих материалах, стоит разобраться с одним техническим обстоятельством — именно оно во многом определяет, почему тема вообще считается такой запутанной. Речь о принципиальной непрозрачности готовой модели. Когда обучение завершено, она представляет собой терабайты числовых коэффициентов, и ни один инструмент не позволяет вскрыть их и доказать, что вот этот конкретный роман или вот эта фотография участвовали в тренировке. Исходный текст не лежит внутри весов в виде, который можно предъявить как улику, — он растворен в статистике, и строго, математически подтвердить факт его использования после обучения невозможно.
Отсюда рождается соблазнительный, но ошибочный вывод: раз доказать присутствие конкретного произведения в обученной модели нельзя, то и спрашивать не с кого. На деле непрозрачность модели вовсе не оставляет авторов беззащитными — она лишь смещает точку, в которой закон способен вмешаться. Проверить веса действительно не выйдет, но у любого обучения есть два наблюдаемых момента: то, что подается на вход, и то, что модель выдает на выходе. Именно на этих двух участках и работает правовая защита — причем в российском законодательстве она уже прописана, то есть изобретать новые нормы ради нейросетей даже не требуется.
Вход и выход
Любой обучающий набор, будь то коллекция текстов или изображений, с точки зрения права представляет собой базу данных, а у баз данных в российском законодательстве есть оговоренная защита. Статья 1334 ГК РФ закрепляет за их изготовителем смежные права. Это означает, что способ получения данных имеет значение сам по себе — еще до всякого обучения. Если разработчик датасета тайком выкачал закрытую библиотеку или коммерческую базу, чтобы затем скормить ее модели, нарушение произошло уже в этот момент — независимо от того, что потом получилось на выходе и можно ли это доказать. Никакой особой статьи про ИИ здесь не нужно: нарушены ровно те же нормы, которые защищают любую базу данных от несанкционированного копирования.
Если же говорить о точке выхода, то сгенерированный результат считается самостоятельным произведением, но оно точно так же, как и данные на входе, не должно посягать на права других авторов. Если модель воспроизводит чужой текст дословно или выдает изображение, до степени смешения повторяющее оригинал, налицо прямое использование чужих авторских прав. В этом случае включается статья 1266 ГК РФ — она закрепляет право на неприкосновенность произведения, запрещая без согласия автора вносить в его текст или изображение любые изменения, искажения и дополнения. Показательно, что для оценки такого нарушения непрозрачность модели вообще не имеет значения. Спорный результат лежит перед глазами, его можно сравнить с оригиналом и оценить как любое другое заимствование.
Права никто не отменял
Главная проблема заключается в том, что точками входа и выхода риски не ограничиваются. Самая недооцененная сложность прячется там, где, казалось бы, никаких сложностей быть не должно, — в материалах, уже перешедших в общественное достояние. Классический роман или старинная картина, у которых давно истек срок исключительных прав, воспринимаются как безусловно бесплатный материал. Но исчезновение имущественных прав — это еще не полная свобода, и как раз здесь проходит граница, которую регулирование пока не замечает.
Дело в том, что наряду с имущественными у автора есть личные неимущественные права, и они устроены принципиально иначе. Право на неприкосновенность произведения, закрепленное в статье 1266 ГК РФ, охраняется бессрочно и в общественное достояние само собой не переходит. Оно не растворяется вместе с истечением срока исключительных прав, а продолжает действовать вечно, и распоряжаться им можно только через отдельное урегулирование с наследниками, правообладателями и авторами — даже в тех случаях, когда автор в свое время отказался от прочих прав на произведение. То же касается и права на имя по статье 1265 ГК РФ. Формально свободный материал на поверку оказывается свободным лишь наполовину.
Для ИИ это оборачивается вполне конкретным риском. Когда модель на выходе искажает классический текст, дописывает фразу в манере автора или дорисовывает недостающие элементы на старинном полотне, она вторгается ровно в ту зону, которую закон защищает без срока давности. И здесь становится видно, почему призывы ввести особый статус обучения бьют мимо цели. Такие поправки не разрешают конфликт личных неимущественных прав с генеративными технологиями, а попросту выносят его за скобки, оставляя без ответа. Именно в этом, а не в мнимой нехватке новых законов, и состоит настоящий подвох обучения ИИ на общедоступных материалах.






























