Искусственный интеллект делает более быстрым и простым извлечение конфиденциальной личной информации из обычных бизнес-данных. Вице-президент Gartner Барт Виллемсен объясняет порталу InformationWeek, почему это происходит и что должны делать руководители служб информационной безопасности (CISO).

Правила регулирования конфиденциальности данных, например европейский GDPR и американские федеральные законы, такие как HIPAA, больше не достаточны для защиты персональных данных в эпоху ИИ.

Gartner прогнозирует, что к 2029 г. большинство инцидентов, связанных с нарушением конфиденциальности, будут вызваны ИИ-выводами об отдельных лицах, а не прямым раскрытием личной информации, такой как имена, адреса и номера социального страхования.

По словам Виллемсена, способность ИИ быстро распознавать образы означает, что злоумышленникам больше не нужно красть или покупать учетные данные, чтобы получить конфиденциальную информацию о людях. Анонимизация данных сама по себе не обеспечивает достаточной защиты, поскольку алгоритмы ИИ могут повторно идентифицировать людей или выводить конфиденциальные атрибуты из анонимизированных наборов данных.

«Настоящей анонимизации не существует, за исключением фактического удаления данных. Атака на основе инференса очень эффективна, потому что она затрагивает всё, а не только непосредственно идентифицируемые репозитории», — говорит Виллемсен.

По мере совершенствования генеративного ИИ и машинного обучения эти технологии могут выводить конфиденциальные личные характеристики — такие как состояние здоровья или поведенческие модели — из анонимизированных или агрегированных данных.

«Современные модели могут восстанавливать личные данные, используя поведенческие модели, показатели использования и агрегированные записи транзакций. Например, ИИ может идентифицировать людей по данным о поездках, социальным сетям, рентгеновским снимкам, ЭКГ, МРТ, даже походке или практически любой комбинации из примерно трёх транзакций», — объясняет Виллемсен.

Кроме того, по его словам, когда ИИ галлюцинирует или создает синтетические данные о людях, эти неверные данные могут вызывать реальные проблемы. Например, предвзятость и галлюцинации ИИ могут привести к неправомерному тюремному заключению и серьезным ошибкам в юридических исследованиях.

Последствия выходят далеко за рамки нарушений конфиденциальности, считает Эндрю Обадиару, CISO компании Cobalt. «ИИ может определить состояние здоровья человека, его финансовое положение, влияние внутри организации или вероятность ответа на фишинговое письмо, не имея доступа к медицинской карте или кадровому делу», — говорит он.

По его словам, данные, которые не кажутся конфиденциальными — такие как справочники сотрудников, отношения с поставщиками, активность в социальных сетях или взаимодействие с клиентами — могут стать ценными, когда ИИ связывает эти фрагменты. ИИ может использовать их для определения структуры подчиненности, администрирования систем, взаимоотношений между руководителями, полномочий по расходам или того, какой инженер отвечает за критически важную производственную систему. Затем злоумышленники могут использовать эти данные, чтобы сделать свои атаки гораздо более точными.

«В результате фишинговые кампании становятся значительно более убедительными, компрометация корпоративной электронной почты происходит быстрее, вымогательство — более целенаправленным, а операции по вторжению — гораздо эффективнее, поскольку злоумышленник уже знает, кого атаковать, прежде чем отправить первое письмо», — поясняет Обадиару.

Организациям необходимо начать задумываться не только о том, какие данные они собирают, но и о том, «что эти данные раскрывают, когда они объединяются, сопоставляются и интерпретируются все более совершенными системами ИИ», — добавляет он. И, из-за развития технологий ИИ, правила обеспечения конфиденциальности, которые исторически были сосредоточены на непосредственно идентифицируемых данных, должны также распространяться на косвенно или повторно идентифицируемый контент.

«Сочетание данных, зарегистрированных где угодно, доступа к ним по всему миру (случайно или в результате злонамеренного взлома) и возможностей, доступных любому, кто хочет получить доступ к данным с помощью современных аналитических и генеративных ИИ-технологий, — вот что отличает сегодняшнюю ситуацию. Кроме того, организации практически не очищают данные, которые им больше не нужны», — говорит Виллемсен.

По его словам, риск повторной идентификации данных существовал задолго до сегодняшнего бума ИИ, но ИИ значительно ускоряет этот процесс. Он ссылается на исследование 2019 г., проведенное специалистами в области науки о данных Люком Роше, Жюльеном М. Хендрикксом и Ивом-Александром де Монжуа, которые разработали генеративную графическую модель для повторной идентификации людей. «Используя нашу модель, мы обнаружили, что 99,98% американцев будут правильно идентифицированы в любом наборе данных с использованием 15 демографических атрибутов», — написали они.

ИИ усиливает угрозу повторной идентификации

По словам Обадиару, что изменилось с развитием ИИ, так это то, что теперь «скорость на стороне злоумышленников — и масштаб». «Пять лет назад создание подробных профилей тысяч потенциальных жертв было экономически нецелесообразным. Сегодня это не так», — отмечает он.

Виллемсен обращает внимание на исследование 2026 г., проведенное инженерами Саймоном Лерменом, Даниэлем Палекой, Джошуа Свансоном, Майклом Аэрни, Николасом Карлини и Флорианом Трамером. Авторы обнаружили, что больше языковые модели (LLM) могут повторно идентифицировать людей, «используя только псевдонимизированные онлайн-профили и переписки, что сопоставимо с тем, что может выполнить опытный следователь за много часов работы».

Примечательно пояснение авторов: «В каждой ситуации методы на основе LLM значительно превосходят классические базовые методы, достигая до 68% полноты при 90% точности по сравнению с почти 0% для лучшего метода без применения LLM. Наши результаты показывают, что практическая неопределенность, защищающая псевдонимных пользователей в Интернете, больше не действует и что модели угроз для конфиденциальности в Интернете необходимо пересмотреть».

По словам Обадиару, лучшие атаки на основе инференса совсем не выглядят как атаки. «Злоумышленник может начать с LinkedIn, публичных документов, социальных сетей, украденных учетных данных, активности на GitHub и утечек маркетинговых баз данных. Ни один из этих наборов данных сам по себе не представляет особой ценности. Но ИИ выполняет сложную работу по их объединению», — отмечает он.

По словам Виллемсена, чтобы снизить риски нарушения конфиденциальности, основанные на инференсе, CISO следует начать с обеспечения управления данными на протяжении всего их жизненного цикла и удаления данных, как только они перестанут приносить бизнес-ценность, которая оправдывала бы затраты и риски их защиты. «У данных есть жизненный цикл, и мы знаем, что хранить их вечно — это неразумно. Поэтому жестко запрограммируйте его конец», — советует он.

Шаги по устранению основанных на инференсе рисков от Gartner

По словам Виллемсена, для CISO защита от угроз, основанных на ИИ-инференсе, начинается с управления ИИ. Вот его советы:

• Управление ИИ. Внедрите в разработку ИИ установление механизмов защиты конфиденциальности на этапе проектирования и регулярно оценивайте риски предвзятости или инференса.

• Внедрение технологий повышения конфиденциальности (PET). PET — это «набор технологических инструментов», — говорит Виллемсен. Эти технологии защищают персональные данные, обрабатывая их в защищенном состоянии или в рамках «конфиденциальных вычислений». К PET относятся дифференциальная конфиденциальность, синтетические данные, машинное обучение с учетом конфиденциальности и гомоморфное шифрование, которое выполняет вычисления над зашифрованными данными без необходимости их предварительного расшифрования. PET могут свести к минимуму вероятность повторной идентификации ИИ отдельных лиц, даже если ИИ проанализирует данные.

• Контроль жизненного цикла. Сбор данных должен ограничиваться основными потребностями бизнеса и включать контроль доступа. Данные следует удалять, как только они перестают быть полезными и/или их защита становится экономически нецелесообразной. Что касается управления данными, то Виллемсен советует проводить «последовательную и очень тщательную очистку».

• Повышение кибербезопасности для угроз, основанных на ИИ. Организациям следует расширять свои традиционные подходы к кибербезопасности, уделяя приоритетное внимание расширенному мониторингу, обнаружению аномалий и возможностям планирования сценариев для выявления угроз, основанных на инференсе.

• Прозрачность и человеческий контроль. Задокументируйте, где в сети организации уместно использование ИИ-инференса, регулярно проводите аудит систем ИИ и поддерживайте участие человека в проверке выводов, генерируемых ИИ, прежде чем допустить технологию действовать с конфиденциальными данными.

«Не стоит недооценивать риски, связанные с различными типами ИИ, прежде чем использовать какой-либо из них», — заключает Виллемсен.