По мере того как организации инвестируют в искусственный интеллект, многие сталкиваются с новым узким местом: сложностью получения данных, которые были бы одновременно защищенными и полезными, пишет на портале The New Stack Маянк Ахлувалия, старший менеджер по продуктам компании Perforce Delphix.

Для проверки изменений, внесенных ИИ, обучения моделей, тестирования приложений и получения бизнес-инсайтов инженерным командам нужны реалистичные данные, максимально приближенные к производственным. Однако меры по обеспечению конфиденциальности иногда затрудняют доступ к таким данным, делают их менее репрезентативными или нарушают критически важные взаимосвязи между записями.

Эта проблема подчеркивается в отчете Perforce Delphix «2026 State of AI and Data Privacy Report». 26% опрошенных организаций отмечают, что меры по защите конфиденциальности затрудняют получение данных производственного качества, 25% сталкиваются с трудностями при сохранении взаимосвязей между сущностями данных, а 51% указывают на проблемы с качеством данных.

Защиты данных недостаточно, если они больше не могут обеспечивать работу зависящих от них систем. Для инженерных команд ключевой вопрос заключается в том, позволяют ли их стратегии защиты данных сохранить те качества, которые и делают эти данные ценными. Необходима комплексная стратегия работы с данными и инструменты, поддерживающие ссылочную целостность и взаимосвязи между различными средами.

Что эта статистика означает для специалистов-практиков

На первый взгляд, данные отчета — например, о том, что 51% предприятий сталкиваются с проблемами качества данных, — могут показаться вопросом, касающимся исключительно управления.

На практике же это инженерные проблемы. Использование наборов данных низкого качества может привести к следующим последствиям:

• Неточная аналитика.

• Плохо обученные модели ИИ.

• Неполное покрытие тестами.

• Увеличение объема работ по исправлению ошибок.

• Задержки релизов.

• Снижение доверия к автоматизации процессов обработки данных.

Когда модель ИИ обучается на неполных или искаженных данных, результаты ее работы становятся менее надежными. Если тестовые среды содержат нереалистичные данные, дефекты могут попасть в рабочую среду. При отсутствии согласованности в аналитических наборах данных команды тратят больше времени на проверку результатов, чем на принятие решений на их основе.

Защита данных и их полезность — цели, которые не противоречат друг другу

Распространено заблуждение, что организациям приходится выбирать между конфиденциальностью и инновациями. Однако самые успешные компании знают: соблюдение нормативных требований, качество и скорость могут и должны работать сообща.

Даже будучи защищенными данные должны:

• Быть достаточно реалистичными для тестирования и проверки.

• Быть достаточно репрезентативными для аналитики.

• Быть достаточно доступными для инженерных команд.

• Соответствовать требованиям регуляторов.

• Сохранять связи, обеспечивающие ссылочную целостность.

В эпоху ИИ перед организациями стоит двойная задача: снизить риски раскрытия конфиденциальных данных и одновременно создать надежные данные, сохраняющие свою ценность после защиты. Слишком часто компании жертвуют соблюдением требований ради инноваций или скорости. Именно поэтому 84% респондентов, участвовавших в нашем исследовании, допускают исключения в правилах защиты конфиденциальности данных для сред, не используемых в промышленной эксплуатации.

Организации могут развиваться со скоростью, требуемой для внедрения ИИ, только при наличии доступа к надежным данным, точно отражающим реальные операционные условия. Если меры по обеспечению конфиденциальности снижают качество, ограничивают реалистичность или доступ к репрезентативным наборам данных, уровень данных становится новым узким местом.

Почему ссылочная целостность важна как никогда

Многие дискуссии о конфиденциальности данных сводятся к маскированию конфиденциальных полей. Однако маскирование, нарушающее ссылочную целостность между сущностями, может создать риски иного рода.

Запись о клиенте, заказе или платеже может быть сохранена, но если связи между этими записями будут нарушены в процессе защиты, данные перестанут соответствовать действительности. Возьмем, к примеру, проверку биллинговых данных. Для корректного формирования перечня продуктов или точного расчета начислений необходима ссылочная целостность, особенно когда информация о продуктах, сборах и счетах одного клиента распределена по нескольким таблицам базы данных.

Нарушение связей представляет особую проблему для современных систем ИИ и аналитики. Аналитические конвейеры зависят от согласованности идентификаторов, позволяющих объединять информацию из разных источников. Процессы ИИ и машинного обучения требуют полного бизнес-контекста для выявления закономерностей и построения прогнозов. Тестирование ПО опирается на реалистичные связи между записями, что необходимо для точной проверки поведения приложений.

При утрате ссылочной целостности:

• Аналитика может давать неполные или вводящие в заблуждение результаты.

• Модели ИИ могут обучаться на некорректных наборах данных.

• Тестовые среды могут не выявлять проблемы, возникающие в реальных операциях.

• Команды теряют доверие к защищенным наборам данных.

Важно отметить, что подобные сбои зачастую трудно обнаружить. Конвейеры могут продолжать успешно работать, но при этом незаметно выдавать некачественные результаты, что может обернуться весьма дорогостоящей ошибкой.

Это помогает объяснить, почему 25% опрошенных организаций назвали сохранение взаимосвязей между объектами данных серьезной проблемой. Для специалистов-практиков эта статистика служит предупреждением: меры по обеспечению конфиденциальности могут непреднамеренно снизить качество инициатив в области ИИ и аналитики, если при их внедрении не учитывается бизнес-контекст.

Важно помнить, что не все решения по защите данных одинаковы: для сохранения взаимосвязей ключевое значение имеют алгоритмы маскирования корпоративного уровня. При их последовательном применении в масштабах всей организации одни и те же исходные данные преобразуются в идентичные маскированные результаты во всех системах и средах. Другие подходы к маскированию могут реализовываться фрагментарно, что приводит к нарушению взаимосвязей.

Что следует измерять инженерным командам

Многие организации оценивают эффективность мер по обеспечению конфиденциальности исключительно по показателям соответствия нормативным требованиям. Однако среды, использующие ИИ, требуют более широкого понимания успеха. Руководителям инженерных подразделений следует оценивать инициативы в области конфиденциальности по нескольким критериям:

• Качество данных: точно ли защищенный набор данных отражает условия промышленной эксплуатации?

• Реалистичность: могут ли разработчики, специалисты в области науки о данных и аналитики уверенно использовать эти данные по назначению?

• Ссылочная целостность: сохраняется ли согласованность взаимосвязей между приложениями, таблицами, средами и источниками данных?

• Доступность: могут ли команды получать данные, соответствующие требованиям, без задержек?

• Скорость предоставления: как быстро можно получить надежные наборы данных при необходимости?

Эти показатели помогают организациям определить, способствуют ли меры по обеспечению конфиденциальности достижению целей в сфере ИИ или создают новые препятствия.

Проектирование с учетом управления данными по умолчанию

По мере распространения ИИ обеспечение конфиденциальности не может оставаться отдельным процессом, запускаемым уже после начала разработки. Вместо этого организациям следует выстроить карту полного жизненного цикла данных: от запроса и обнаружения до повторного использования и вывода из эксплуатации.

Такой подход позволяет встроить механизмы управления данными непосредственно в рабочие процессы, а не применять их как контрольный этап на поздней стадии. Это также обеспечивает более надежный аудит, снижает количество случаев отступления от нормативных требований и повышает уверенность команд в том, что защищенные наборы данных остаются пригодными для использования по назначению.

Что особенно важно, это позволяет согласовать цели в области конфиденциальности с бизнес-результатами, вместо того чтобы рассматривать их как конкурирующие приоритеты.

Надежные данные станут конкурентным преимуществом

Потребность в тестовых данных — с точки зрения объема, охвата и масштаба — стремительно растет по мере развития технологий агентной разработки. ИИ также увеличивает объем изменений, генерируемых предприятиями, однако проблема проверки этих изменений остается нерешенной.

Решение этой задачи по-прежнему зависит от данных. Организации, которые извлекут наибольшую пользу из внедрения ИИ, не обязательно будут обладать самыми совершенными моделями. Лидерами станут те, кто обеспечит наиболее надежную основу для работы с данными, применяя комплексный подход: сочетание виртуализации данных (для быстродействия), маскирования (для безопасности) и — при необходимости — синтетических данных (для обеспечения полноты охвата).

Результаты исследования указывают на важный вывод: если меры по защите конфиденциальности позволяют сохранить реалистичность и качество данных, а также взаимосвязи между записями и доступ к репрезентативным наборам данных, они могут способствовать успеху внедрения ИИ.

В условиях, когда компании продолжают инвестировать в технологии ИИ и обеспечение конфиденциальности данных, главной целью должно стать гармоничное сочетание безопасности и практической ценности. Ведь в эпоху ИИ именно надежные данные, а не высокая скорость получения результатов модели, могут стать решающим конкурентным преимуществом.