Финансовые, а не инженерные аспекты губят проекты по внедрению агентного искусственного интеллекта. Поскольку объем телеметрических данных в ближайшие два года вырастет на порядок, конвейеры наблюдаемости становятся контрольным звеном, сообщает портал The New Stack.
По мере того как компании переходят от экспериментов с ИИ к запуску автономных агентов в производственной среде, возникает проблема, связанная с инфраструктурой: растущие расходы на телеметрию. Недетерминированные, итеративные агенты, способные генерировать данные со скоростью машин, гораздо сложнее поддаются мониторингу, а расходы на них спрогнозировать гораздо сложнее, чем в случае с обычными приложениями.
Многие компании испытывают трудности с выделением и обоснованием расходов на телеметрию. Согласно опросу более 300 руководителей в сфере корпоративных ИТ в Северной Америке и Западной Европе, проведенному Omdia/Informa TechTarget по заказу Apica, 59% организаций уже прекратили или отложили внедрение ИИ-агентов из-за расходов на мониторинг.
Чаще всего это происходит при внедрении ИИ-агентов в критически важных областях: например, в сферах кибербезопасности, соблюдения нормативных требований и выявления мошенничества. По мере роста расходов на мониторинг, проекты по внедрению ИИ-агентов далеко не всегда закрываются по инициативе инженерных команд. Чаще всего их закрывает финансовый отдел.
Энди Манн, директор по продуктам и технологиям Apica, недавно стал свидетелем того, как это произошло в одном крупном банке. Организация не смогла точно определить свои затраты на программы ИИ. «Они поняли, что не могут позволить себе продолжать в том же духе, поэтому у них не было другого выбора, кроме как отменить некоторые программы ИИ, — рассказывает он. — Я уже сталкивался с такими вещами, потому что ИИ-проекты легко съедают типичные бюджеты».
Последствия огромны. По мере того, как люди, финансирование и ресурсы мониторинга перенаправляются на новые рабочие нагрузки ИИ, другие подразделения бизнеса начинают страдать. Манн говорит, что он видит перебои в работе, простои и атаки с проникновением, а средства защиты от DDoS-атак конкурируют за одни и те же ресурсы.
Исследование Apica также выявило эту проблему. Только за последний год на большинстве предприятий (54%) объем телеметрии утроился, причем 43% этого роста приходится на рабочие нагрузки ИИ/машинного обучения, что, безусловно, является основным фактором. Предприятия вынуждены бороться с этим кризисом, поскольку их расходы на наблюдаемость растут. Они сообщают, что тратят в среднем 3,17 млн. долл. на обеспечение наблюдаемости, причем эта цифра растет на 28% в годовом исчислении и предела этому росту не видно. Неудивительно, что 83% опрошенных считают ИИ-наблюдаемость главным приоритетом на ближайший год.
Грядущая волна может оказаться катастрофической
При появлении нового облачного сервиса, базы данных или приложения нагрузка на систему мониторинга и объем телеметрических данных обычно увеличиваются на относительно предсказуемую величину. Но сейчас компании прогнозируют, что в течение двух лет объем телеметрических данных вырастет в среднем в 9,5 раза. Около 44% организаций ожидают, что объем телеметрических данных вырастет в
«Представьте, что ваш счет по кредитной карте или чек из супермаркета выросли почти на порядок. Это уже не просто увеличение. Это не плавный рост, а стремительный взлет, и это вызывает панику», — говорит Манн.
Причина в том, что работа агента — это не то же самое, что отдельный запрос к приложению. Задача службы поддержки может включать в себя трассировку верхнего уровня, несколько вызовов модели, операции извлечения данных, вызовы инструментов, повторные попытки и циклы. Но если агент делегирует работу другому агенту, это добавляет в трассировку еще одну ветвь.
Каждая модель может генерировать данные о токенах, задержках, затратах и поставщиках, а каждый вызов инструмента создает собственные записи об аргументах, результатах, статусе и последующих действиях. Идентификаторы, такие как tool_name, agent_id и trace_id, также создают избыточность данных, из-за чего их сложнее агрегировать и дороже индексировать, и затраты растут на каждом этапе.
Это создает ощутимый разрыв между амбициями в области ИИ и готовностью инфраструктуры. Несмотря на то, что 35% компаний заявляют о широком внедрении агентного ИИ, эксплуатация и управление такими системами сильно отличаются от того, что было раньше. Почти две трети компаний лишь в некоторой степени готовы к таким изменениям. В отличие от обычных приложений, агенты могут вызывать множество моделей и инструментов, повторно выполнять задачи или расширять рабочий процесс непредсказуемым образом, из-за чего сложно спрогнозировать затраты на обеспечение производительности и мониторинг.
От огромных затрат на телеметрию до уровня контроля на входе
По словам Манна, решение заключается в том, чтобы вмешаться на более ранних этапах. «Нельзя бесконечно отправлять практически бесполезные данные на дорогостоящую центральную аналитическую платформу или платформу хранения данных, потому что нет смысла анализировать данные, которые говорят о том, что все в порядке, — говорит он. — Как можно раньше подключите конвейер к сборщикам данных и управляйте ими на уровне источника».
Традиционные платформы наблюдаемости ориентированы на сбор данных, их прием, хранение и индексацию, а затем анализ. Такая модель подходила для рабочих процессов, управляемых людьми и анализируемых с помощью дашбордов, но для агентного ИИ необходимо принимать решения до того, как телеметрия дойдет до наиболее затратных частей стека.
Архитектура, ориентированная на конвейер, позволяет отбирать повторяющиеся успешные события, сохраняя при этом данные о сбоях, повторных попытках, нарушениях политик и аномально медленных трассировках. Она позволяет дополнять записи данными об агенте, сеансе, модели, инструменте, токене и предполагаемой стоимости, удалять конфиденциальные запросы и идентификаторы, а также агрегировать метрики и долгосрочные записи и отправлять их в места назначения с разными профилями затрат и хранения.
Компактная метрика или выборка могут отражать обычный успешный вызов инструмента, в то время как при неудачном вызове сохраняется родительская трассировка, сведения об ошибке, история повторных попыток и контекст безопасности. Цель состоит в том, чтобы сохранить информацию, необходимую для объяснения поведения агента, сократив при этом объем избыточных данных и ограничив объем индексируемой информации.
Агентам также необходим контекст на уровне миллисекунд для принятия автономных решений. Обработка телеметрии в непосредственной близости от источника позволяет организациям быстро выявлять ситуации, когда происходит слишком много повторных попыток, чрезмерное количество циклов использования инструментов или аномально высокий расход токенов, не дожидаясь, пока данные будут собраны и проиндексированы централизованно.
Без контроля на уровне источника компании рискуют передавать фрагментированные и ненужные телеметрические данные на платформы, которые взимают плату за каждый дополнительный гигабайт, индекс и сохраненную запись.
Архитектура, которая отделяет победителей от проигравших
Трудно не заметить, насколько выгоден подход, при котором переосмысливается конвейер сбора телеметрических данных. Использующие его компании на 50% лучше подготовлены к росту объемов данных, связанному с агентным ИИ. Именно внедрение такого подхода выделяет зрелые организации, использующие агентный ИИ, на фоне конкурентов: такие организации на 80% реже сталкиваются с проблемами, связанными с операционными расходами, которые мешают их конкурентам.
Решение заключается в том, чтобы перенести аналитические функции на более ранние этапы. Вместо того чтобы рассматривать платформу наблюдаемости как универсальный инструмент, компании могут принимать решения о том, какие телеметрические данные использовать, еще до того, как они попадут на платформу, — отфильтровывая ненужную информацию, выделяя то, что действительно важно, и маршрутизируя данные в соответствии с их ценностью и назначением. Это означает, что в дорогостоящие системы хранения и анализа будет поступать меньше данных, а та информация, которая все же попадет в эти системы, будет более полезной и доступной в режиме реального времени.
Важно отметить, что речь не идет о полном отказе от платформ наблюдаемости, на которые уже полагаются компании. Речь идет о том, чтобы создать перед ними более интеллектуальный контрольный слой, который будет решать, какие данные заслуживают обработки, куда их следует направлять и сколько это будет стоить.
Существующие платформы наблюдаемости по-прежнему играют важную роль. «Конвейер не может делать все, но он может взять на себя первичную обработку данных, — говорит Манн. — Вы по-прежнему работаете с крупными аналитическими платформами, но при этом экономите деньги, снижаете риски и повышаете эффективность соблюдения нормативных требований».
Согласно исследованию Apica, контрольный конвейер, базовые метрики и сервисы подготовки данных позволяют снизить совокупную стоимость владения на 40% по сравнению с унаследованными платформами наблюдаемости. Разумеется, фактическая экономия будет зависеть от объемов телеметрии, политики хранения данных, правил выборки, решений по маршрутизации, действующих контрактов и доли данных, которые можно обработать до приема в систему.
Сейчас самое время пересмотреть архитектуру. Около 68% компаний планируют в течение следующих шести месяцев оценить изменения в своей системе наблюдаемости, а почти четверть из них заявляют, что существующие отношения с поставщиками не будут играть существенной роли при принятии этих решений. Следующий этап развития системы наблюдаемости будет связан с умением справляться с тем, что ИИ будет «выбрасывать» в инфраструктуру.
Это означает, что конвейер больше нельзя рассматривать как систему, которая просто перемещает телеметрические данные из пункта А в пункт Б. Он становится управляющим слоем для все более автономной и требовательной к данным среды.
Организации, которые создадут инфраструктуру, готовую к работе с агентным ИИ, смогут снизить затраты на наблюдаемость и повысить эффективность управления рисками. Манн не считает, что у платформенных инженеров и SRE-команд есть большой выбор. «Это уже становится решением на уровне совета директоров, — говорит он. — В конечном счете, это выбор того, насколько разумно вы можете позволить себе вести свой бизнес».





























