Центры обработки данных сталкиваются с растущими рисками со стороны киберфизических систем (КФС). Безопасность операционных технологий (ОТ) имеет решающее значение для предотвращения сбоев и обеспечения операционной устойчивости, пишет на портале Data Center Knowledge Шон Тафтс, технический директор Claroty.
Устойчивость дата-центров выходит на первый план, и безопасность является ключевой частью этой истории. К ЦОДам все чаще относятся как к критической инфраструктуре, поскольку от них зависит значительная доля экономического роста и операций по обеспечению безопасности.
Но слишком часто защита ограничивается периметром. Внутри ограждения накапливается отдельный и недостаточно изученный риск: ОТ и КФС, которые обеспечивают работу этих объектов. К источникам бесперебойного питания (ИБП), блокам распределения питания, системам охлаждения, датчикам окружающей среды и платформам управления зданиями теперь регулярно подключаются, часто через инструменты удаленного доступа и устаревшие протоколы, которые никогда не были разработаны для современного ландшафта угроз.
Это не ИТ-системы, и большинство организаций не управляют ими как таковыми. Когда этот уровень скомпрометирован, это часто выглядит не как взлом, а как сбой. По мере того, как спрос, обусловленный искусственным интеллектом, ускоряет зависимость от подключенной операционной инфраструктуры, масштаб того, что зависит от этих систем, также меняется. Объекты, которые обучают и запускают модели ИИ, теперь являются стратегическими активами, и стоимость отключения масштабируется в зависимости от всего, что теперь от них зависит.
Дата-центр — это киберфизическая экосистема
Большинство операторов интуитивно понимают физическую структуру дата-центра: «белая» зона, где находится ИТ-нагрузка, и «серая» зона, где находятся электропитание и системы отопления, вентиляции и кондиционирования (ОВиК). Проблема в том, что организационные структуры не развиваются так быстро, как технологии. Команды по эксплуатации говорят на языке электрического напряжения и охлаждения. Команды по безопасности говорят на языке пакетов и уязвимостей.
Традиционные системы безопасности не были созданы для этой среды, и ни одна из сторон не имеет инструментов для преобразования рисков другой стороны в оперативные действия. В результате возникает разрыв в ответственности, прозрачности и приоритизации. Именно в этом разрыве и рождаются сбои.
Также меняется то, как выглядит инцидент. Корпоративная ИТ-безопасность в значительной степени строится вокруг конфиденциальности. Для ЦОДа основным последствием часто является сбой. Это может проявляться в неожиданном отключении, ложных показаниях и задержке срабатывания сигнализации, а также в ухудшении работы системы охлаждения, вызывающем термическое дросселирование. В худшем случае локальный сбой, например, отключение питания на уровне стойки, может привести к каскадному распространению сбоев в вышестоящих системах объекта.
Понимание этого различия должно изменить подход руководителей к оценке результатов обеспечения безопасности. Вопрос не только в том, «предотвращаем ли мы вторжения?», но и в том, «можем ли мы поддерживать безопасную работу во время вторжения?». В этом и заключается суть устойчивости.
Ставки выше, чем осознает большинство людей
Одна из причин, по которой обсуждение этой темы затягивается, заключается в том, что мы не в полной мере осознали последствия последовательных сбоев.
Когда выходит из строя один критически важный сектор, другие быстро деградируют. Например, больница зависит не только от врачей и зданий. Ей необходимы медицинские карты, транспорт, хранение лекарств в условиях холодовой цепи и стабильное электропитание для поддержания необходимых условий окружающей среды. Когда эти вспомогательные системы выходят из строя, оказание медицинской помощи часто продолжается, но становится ручным, более медленным и рискованным.
Теперь рассмотрим под этим углом дата-центры. Поскольку ИИ становится неотъемлемой частью работы предприятий, функционирования цепочек поставок и анализа и действий систем национальной безопасности, бесперебойная работа дата-центров становится вопросом экономической безопасности и общественной безопасности, а не просто вопросом доступности услуг.
Проблема не только в увеличении количества ЦОДов. Дело в том, что они проектируются, строятся и вводятся в эксплуатацию быстрее, чем когда-либо прежде, что создает условия, в которых управление, проверка безопасности и операционная зрелость с трудом успевают за этими темпами.
Сверхбыстрый рост создает новые риски
Сверхбыстрый рост означает, что система управления с трудом успевает за темпами освоения новых площадок, быстрого развертывания устройств и сокращения сроков развертывания. Когда организации начинают строительство нового дата-центра каждые три месяца, скорость создает проблемы для всей цепочки поставок и качества работы.
• Цепочка поставок. Технологии, обеспечивающие энергоснабжение и охлаждение современных дата-центров, быстро развиваются. Многие новые поставщики, включая стартапы и компании из регионов с частичным доверием, могут не иметь зрелых циклов безопасной разработки ПО и производственных процессов. По мере того, как эти технологии внедряются в критическую инфраструктуру, становятся необходимыми отказоустойчивые программы КФЗ для управления рисками со стороны третьих лиц.
• Качество. Рынок вознаграждает скорость, и огромные деньги могут зависеть от соблюдения жестких сроков развертывания. Поскольку подрядчики, сторонние организации и внутренние команды работают быстрее, чем когда-либо, ошибки, связанные со скоростью, становятся все более распространенными. Примеры из реальной жизни включают неправильную настройку сегментации сети, открытые порты и неизмененные учетные данные по умолчанию.
Скорость стала конкурентным преимуществом, но также и угрозой безопасности. Без надлежащего уровня управления организации рискуют строить критическую инфраструктуру будущего, используя сегодняшние слепые операционные зоны.
Что говорят исследования
Недавние исследования показывают, насколько напрямую эти уязвимости могут приводить к сбоям в работе. В недавнем отчете Team82 «Attacking UPS Network Cards to Take Down Data Centers» были обнаружены уязвимости почти максимального уровня серьезности в сетевых интерфейсах, используемых для управления системами ИБП. Обход аутентификатора в сочетании с условием удаленного выполнения кода в худшем случае может позволить злоумышленнику обойти средства управления входом в систему и выдавать команды, которые прерывают подачу питания на защищенные нагрузки. В дата-центре это не просто неудобство. Потенциально это событие, способное привести к масштабному отключению.
Результаты другого исследования Team82 «Turning Up the Heat: Hacking Trane HVAC Controllers» выявили цепочку уязвимостей в широко используемом контроллере ОВиК, включая путь к удаленному доступу на уровне root без аутентификации и утечку конфиденциальных данных объекта. В совокупности такая цепочка может дать злоумышленнику влияние на системы охлаждения, которые напрямую определяют, остаются ли стабильными рабочие нагрузки высокой плотности. Охлаждение — это не фоновая система. От нее зависит время безотказной работы, и по мере увеличения плотности размещения оборудования в стойках запас по тепловому режиму уменьшается.
Закономерность важнее отдельных инцидентов. В обоих случаях оборудование, о котором большинство команд ИТ-безопасности редко задумываются, оказалось именно тем оборудованием, которое определяет, останется ли объект в рабочем состоянии.
Устранение пробелов
Многие киберфизические устройства были разработаны для обеспечения безотказной работы и ремонтопригодности в эпоху ограниченных возможностей подключения и совершенно иной модели угроз. Сегодня подключенность является требованием бизнеса; удаленное обслуживание стало обычным явлением, и эти системы часто полностью выходят за рамки традиционного управления ИТ-уязвимостями. Команды по эксплуатации объектов располагают отношениями с поставщиками, но им не хватает рабочего процесса для отслеживания рисков, связанных со встроенным ПО. Команды безопасности знают, как операционализировать управление уязвимостями, но не контролируют активы.
Начните с обеспечения видимости активов как в «серой», так и в «белой» зонах, чтобы знать, что имеется, где оно находится, с чем оно взаимодействует и какие протоколы и версии прошивки оно использует. Сопоставьте эти активы с операционными целями, чтобы ремедиационные и компенсационные меры отдавали приоритет тому, что наиболее важно для безотказной работы. Далее, сегментация должна стать первоклассным инструментом контроля бесперебойной работы, ограничивая обмен данными только необходимыми ресурсами, разрешая управляющий трафик только авторизованным каналам и разделяя сети управления и бизнес-сети, чтобы компрометация не приводила к масштабным проблемам на всем предприятии. Примените тот же подход к удаленному доступу, обеспечив надежную аутентификацию, принцип минимальных привилегий и возможность аудита сеансов для поставщиков и подрядчиков.
Наконец, рассматривайте обнаружение и реагирование как киберфизические дисциплины, сопоставляя события безопасности с операционными аномалиями и обеспечивая, чтобы сценарии реагирования предвидели манипуляции с системами мониторинга и управления, с целью предотвращения превращения инцидентов в простои.
Почему это важный вопрос для руководства
Страховщики все чаще ожидают наличия проверяемых доказательств киберфизических мер контроля, обеспечивающих операционную устойчивость. Это означает прозрачность в отношении КФС-активов, сегментацию, ограничивающую радиус поражения, регулируемый удаленный доступ и отчетность, показывающую прогресс во времени. Эти ожидания все больше соответствуют строгим требованиям, предъявляемым к другим секторам критической инфраструктуры.
Это переводит безопасность ОТ из технической в бизнес-тему. Если бесперебойная работа — это продукт, то киберфизическая устойчивость — это часть качества продукта.
В отрасли справедливо уделяют основное внимание физическим угрозам и безопасности периметра. Но системы, обеспечивающие бесперебойную работу, охлаждение серверов и электроснабжение, заслуживают не меньшего внимания. Потому что, когда этот уровень выходит из строя, в новостях редко появляется сообщение «нарушение безопасности». Вместо этого появляется сообщение «сбой».





























