Инфраструктура искусственного интеллекта требует системного подхода к проектированию, который интегрирует электропитание, охлаждение и вычислительные ресурсы для оптимизации эффективности, отказоустойчивости и адаптивности, а не только мощности, пишет на портале Data Center Knowledge Крис Батлер, президент подразделения встроенного и критически важного электропитания компании Flex.
В течение многих лет проектирование центров обработки данных определялось простой целью: создать достаточно мощностей для удовлетворения спроса. Такой подход имел смысл, когда рабочие нагрузки были более предсказуемыми, но ИИ меняет эту ситуацию.
Современная инфраструктура должна поддерживать более высокую плотность динамических рабочих нагрузок, одновременно более эффективно используя электроэнергию и ресурсы. Такой сдвиг — это не просто эффективность ради эффективности. Более эффективное использование инфраструктуры может помочь снизить эксплуатационные расходы, повысить отказоустойчивость и упростить адаптацию по мере развития рабочих нагрузок.
Учитывая, что только в США строится более 1500 дата-центров, у операторов есть возможность заложить эти преимущества в инфраструктуру с самого начала, а не пытаться модернизировать ее позже. Таким образом, следующее поколение инфраструктуры ИИ меньше связано со скоростью строительства или опорой на какую-либо одну технологию, и больше — с системным подходом, учитывающим электропитание, охлаждение, вычислительные ресурсы и эксплуатацию в совокупности.
Почему эффективность становится приоритетом при проектировании
Растущие рабочие нагрузки и меняющиеся требования к инфраструктуре усложняют проектирование и эксплуатацию дата-центров. Поскольку ИИ приводит к увеличению плотности рабочих нагрузок, каждое решение в области инфраструктуры может иметь последствия для других элементов системы.
Например, изменение архитектуры электропитания может повлиять на требования к охлаждению. Решения по охлаждению могут влиять на потребление энергии и воды, а использование вычислительных ресурсов может изменить потребности в электроэнергии и охлаждении. Эти взаимозависимости означают, что эффективность не может быть обеспечена одной командой или дисциплиной изолированно.
Команды должны координировать решения и учитывать последствия своих решений как для вышестоящих, так и для нижестоящих звеньев. Это поможет операторам сбалансировать потребность в новых мощностях с тем, насколько эффективно они используют существующую инфраструктуру.
Это имеет прямые последствия как для стоимости, так и для отказоустойчивости. Более эффективное использование ресурсов может снизить эксплуатационные расходы, а проектирование систем, работающих совместно, уменьшает неэффективность и потенциальные точки отказа. Учет этих факторов на этапе проектирования также может снизить зависимость от дорогостоящей модернизации в дальнейшем.
Системный подход к эффективности
Показатель эффективности использования электроэнергии (PUE) долгое время был стандартным показателем эффективности дата-центров, но он не охватывает все аспекты современной инфраструктуры. Ожидания отрасли относительно того, что представляет собой эффективный объект, изменились. Средний показатель PUE улучшился с 2,50 в 2007 г. до 1,52 в
Этот прогресс показывает, почему операторам необходимо смотреть дальше одного показателя. Более низкий показатель PUE важен, но инфраструктура ИИ также должна учитывать потребление воды, выбросы углерода, использование вычислительных ресурсов, повторное использование энергии и взаимодействие с электросетью.
Более широкая концепция может включать:
• Эффективность использования электроэнергии (PUE) во всех операциях.
• Эффективность потребления воды (WUE), связанного с операциями и охлаждением.
• Экологичность (CUE): углеродный след энергопотребления ИТ-оборудования.
• Эффективность повторного использования генерируемой/потребляемой энергии (ERE).
• Энергоэффективность вычислительных ресурсов (CPE).
• Синхронизация энергопотребления рабочих нагрузок с ограничениями и состоянием электросети (GAE)
В совокупности эти показатели дают операторам более полное представление о компромиссах между мощностью, спросом и использованием.
Проектирование систем электропитания, охлаждения и вычислительных ресурсов с учетом реальных рабочих нагрузок
Ни одна система в одиночку не определяет эффективность инфраструктуры. Электропитание, охлаждение и вычислительные ресурсы должны работать вместе, особенно с учетом того, что высокоплотные рабочие нагрузки ИИ предъявляют новые требования к средам дата-центров.
Чтобы это обеспечить, проектирования инфраструктуры должно учитывать то, как рабочие нагрузки ведут себя изо дня в день. Далее, интегрированные подходы к электропитанию и охлаждению могут повысить надежность развертывания и сделать масштабирование более эффективным, в то время как модульные подходы предоставляют операторам гибкость для адаптации по мере изменения требований.
По мере развертывания инфраструктуры для ИИ такой подход будет способствовать созданию более гибкой цепочки поставок и укреплению сотрудничества между технологическими компаниями. Рост инвестиций в промышленное производство объединит инженерные, интеграционные и производственные возможности, позволив отрасли быстрее реагировать на меняющиеся потребности инфраструктуры.
Оценка эффективности на протяжении всего жизненного цикла инфраструктуры
Эффективность — это не разовое проектное решение; ее необходимо оценивать на всех этапах: от разработки и развертывания до текущей эксплуатации.
Сбалансированный набор показателей позволяет операторам оценивать работу инфраструктуры и выявлять возможности для ее улучшения. В свою очередь, комплексное отслеживание таких параметров, как энергопотребление, расход воды, углеродный след, повторное использование энергии, загрузка вычислительных мощностей и взаимодействие с энергосетью, дает более полную картину, чем любой отдельный показатель.
В условиях изменения рабочих нагрузок ИИ и требований к инфраструктуре постоянный мониторинг обеспечивает операторам необходимую видимость процессов, позволяя корректировать работу системы и поддерживать ее производительность на должном уровне.
Создание инфраструктуры с прицелом на будущее
Масштабы инфраструктуры для ИИ будут расти, однако одной лишь мощности будет недостаточно. Операторам необходимо с самого начала проектировать системы с учетом требований к эффективности, надежности и адаптивности.
Применяя системный подход к вопросам энергоснабжения, охлаждения, вычислений и эксплуатации — а также согласовывая решения между различными техническими дисциплинами, — операторы смогут эффективнее использовать имеющиеся мощности, контролировать эксплуатационные расходы и создавать более устойчивую инфраструктуру.
В конечном счете, критерием успеха инфраструктуры для ИИ станет не просто объем обеспечиваемой ею мощности, а то, насколько эффективно и надежно она способна поддерживать меняющиеся рабочие нагрузки.





























