Выпуск компанией Moonshot AI модели Kimi K3 возобновил споры о том, кто имеет право создавать продвинутый искусственный интеллект и может ли несанкционированная дистилляция дать правительству США основания для ограничения использования моделей с открытыми весами. Арнал Даяратна, вице-президент IDC по исследованиям в области разработки ПО, приводит в корпоративном блоге доводы в пользу того, что открытые веса в сочетании с открытой инфраструктурой для пост-обучения — это основа для более масштабной экосистемы разработки ИИ, а не угроза для неё.
Выпуск модели Kimi K3 усилил споры об открытых моделях и регулировании в сфере передового ИИ, вызвав новую волну критики в связи с сообщениями о том, что OpenAI и Anthropic обратились к правительству США с просьбой ограничить выпуск открытых моделей, которые связывают с несанкционированной дистилляцией. Возможность того, что правительство США может ограничить или запретить использование таких моделей, вызвала бурную реакцию в отрасли. Коалиция, в которую вошли NVIDIA, Microsoft, IBM, Dell Technologies, Palantir, Hugging Face, Mistral, Mozilla и другие технологические компании, подписала письмо, в котором призвала политиков избегать преждевременных ограничений в отношении моделей с открытыми весами и отличать законную дистилляцию от неправомерного использования. Решение о том, стоит ли запрещать использование открытых моделей, таких как Kimi K3, определит, останется ли разработка продвинутого ИИ прерогативой небольшого числа лабораторий или станет доступной для более широкой экосистемы разработчиков.
Более перспективная возможность — создать будущее, в котором возможности ИИ станут доступными, дешевыми, многовариантными и разнородными. Такое будущее зависит от расширения участия в разработке за пределами узкого круга передовых лабораторий и предоставления большему числу организаций возможности развивать ИИ на своих условиях. Открытые веса моделей — это основа, а открытая инфраструктура для пост-обучения — путь от простого доступа к инновациям. Ограничения на публикацию открытых моделей послужат сохранению дефицита в то время, когда начинают формироваться технические основы для создания более широкой и генеративной экосистемы.
Ограничения на использование открытых моделей защитят существующие компании от конкуренции
Запросы от OpenAI и Anthropic представляют дистилляцию как проблему, требующую вмешательства на государственном уровне для ограничения распространения моделей, разработанных другими организациями. Дистилляция — это практика использования результатов работы более мощной модели для обучения или улучшения менее мощной модели. Субъект, который активно обращается к передовой модели в течение многих сеансов, может использовать эти взаимодействия для создания второй модели, которая будет обладать некоторыми возможностями исходной системы. Эта вторая модель будет работать вне поля зрения, контроля доступа и системы безопасности исходного поставщика. OpenAI и Anthropic утверждают, что несанкционированная дистилляция их систем является кражей интеллектуальной собственности и что доступ к открытым моделям, созданным в результате такого копирования, должен быть запрещен.
Однако провайдеры закрытых моделей уже контролируют доступ к системам, из которых происходит предполагаемая дистилляция. Они определяют, кто может использовать их модели, какой уровень доступа предоставляется пользователям, какие интерфейсы доступны, какие условия прописаны в договоре и какие виды автоматизированной деятельности влекут за собой принудительные меры. Провайдеры, считающие дистилляцию существенной угрозой, могут усилить аутентификацию, ввести ограничения на количество запросов, выявлять необычные шаблоны запросов, приостанавливать действие аккаунтов, ограничивать автоматическое извлечение данных и менять дизайн интерфейсов, чтобы скрыть особо ценные обучающие сигналы. Они также могут применять договорные права в отношении пользователей, нарушающих четко прописанные условия предоставления услуг. Вопрос о том, почему эти компании добиваются защиты со стороны регулирующих органов в отношении проблемы, которую они в состоянии решить с помощью собственной инфраструктуры, заслуживает пристального внимания.
OpenAI и Anthropic добиваются вмешательства регулирующих органов в связи с тем, что модели общего назначения становятся все более доступными. Разрыв в возможностях между передовыми и открытыми моделями сокращается во все большем количестве областей, и предприятиям становится все проще заменять одну систему на другую. Открытые модели позволяют предприятиям размещать их у себя и адаптировать под свои нужды, а в перспективе — создавать специализированные системы для решения задач, для которых провайдеры закрытых моделей не разрабатывали свои продукты.
Провайдеры закрытых моделей имеют больше возможностей для установления цен, поскольку немногие другие системы могут обеспечить сопоставимые результаты. Этот авторитет снижается, когда предприятия могут выбирать между несколькими проприетарными сервисами или использовать открытую модель, которую они могут модифицировать и применять в своей инфраструктуре. Даже если организация никогда не внедряла открытую модель, такая модель, оказывает конкурентное давление: сам факт ее существования дает клиентам альтернативу постоянной зависимости от одного поставщика.
Не стоит считать, что открытая модель является результатом несанкционированной дистилляции только из-за того, что она открыта. Эффективная открытая модель может быть результатом государственных исследований, независимых экспериментов, использования синтетических и открытых наборов данных, повышения эффективности обучения или совокупной работы более широкого технического сообщества. Схожесть моделей сама по себе не является доказательством неправомерного заимствования. Регулирование, при котором схожесть возможностей рассматривается как доказательство кражи, позволит действующим поставщикам заявлять о своих исключительных правах на различные формы поведения моделей и общий технический прогресс. Государство не должно превращать опасения закрытых провайдеров по поводу контроля доступа в ограничения для открытой конкуренции.
Открытые модели обеспечивают конкуренцию и возможность создавать
Открытые модели дают организациям прямой доступ к системам ИИ, позволяющий проверять и адаптировать их, а затем использовать их там, где это необходимо. Если организация владеет весами модели, она может оценивать ее поведение напрямую, не полагаясь на доступ, предоставляемый небольшим числом частных лабораторий. Такой прямой доступ обеспечивает возможность кастомизации, локального развертывания, воспроизводимости, независимой проверки безопасности, а также организационный контроль над данными и управлением. Участие в разработке ИИ расширяется, когда все больше организаций могут создавать и тестировать системы, а затем совершенствовать их в соответствии со своими требованиями, а не в рамках ограничений, установленных поставщиком.
Ни один управляемый сервис не может обеспечить такой же уровень контроля, как открытые модели. Государственные и регулируемые организации получают возможность контролировать условия развертывания, границы доступа к данным и соблюдение нормативных требований в рамках используемой ими инфраструктуры. Исследователи получают возможность изучать поведение моделей, тестировать их на безопасность и публиковать результаты без необходимости получать разрешение от разработчика системы. Независимые разработчики получают возможность развивать технические направления, представляющие значительную ценность в конкретной области или сообществе, даже если они не представляют особого коммерческого интереса для передовой лаборатории. Эти возможности зависят от того, кто владеет весами, а не от доступа к интерфейсу поставщика.
Передовой API предоставляет организации доступ к возможностям на условиях, определяемых поставщиком: доступная модель, разрешенные формы использования, ценообразование, ограничения по скорости, политика хранения данных, меры безопасности и сроки внесения будущих изменений. Открытые модели дают другой уровень полномочий. Они позволяют организации проверять модель, использовать ее в рамках подконтрольной ей инфраструктуры, изменять процесс ее обучения, проводить собственные оценки и развивать направления, которые не были предусмотрены первоначальным поставщиком. Разница заключается в том, что в первом случае мы просто потребляем возможности, а во втором — обладаем средствами для их дальнейшего развития. Открытые модели превращают потребителей интеллектуальных технологий в их создателей.
Одних открытых весов недостаточно: пост-обучение тоже должен быть открытым
Пост-обучение — это этап, на котором передовые лаборатории обретают большую часть своего практического преимущества. Без открытой инфраструктуры для пост-обучения открытые веса остаются статичными артефактами. Организация, которая загружает открытую модель, но не имеет инструментов, сред, оценок и воспроизводимых методов, необходимых для ее пост-обучения, может использовать модель в том виде, в котором она была выпущена, но не может изменить ее функциональные возможности. На практике OpenAI, Anthropic и Google, похоже, удерживают свои позиции не столько за счет масштабов предварительного обучения или весов модели, сколько за счет того, что происходит после: масштабируемое обучение с подкреплением, обусловливание использования инструментов, восстановление после сбоев в многоэтапных рабочих процессах, моделирование вознаграждений и накопленный опыт, необходимый для превращения базовой модели в систему, которая надежно работает в производственной среде. Что отличает передовые лаборатории, так это полный набор средств разработки, связанных с этими опубликованными методами: качество обучающих данных, дизайн среды выполнения задач, точность оценок, формирование сигналов вознаграждения и решения команд, которые провели тысячи экспериментов и извлекли уроки из каждой неудачи.
Таким образом, экосистема открытой модели должна включать не только загружаемые контрольные точки. Она должна включать инструменты, среду, оценки и воспроизводимые практики, необходимые для проведения полноценного пост-обучения. Без этих компонентов разрыв между использованием модели и развитием на ее основе специализированных возможностей для большинства организаций остается непомерно большим.
Эта инфраструктура начинает обретать форму. Открытый проект NeMo RL от NVIDIA предоставляет масштабируемую инфраструктуру для обучения с подкреплением и пост-обучения, а NeMo Gym — среды, которые объединяют наборы данных, средства управления агентами, верификаторы и состояния для обучения и оценки. TRL от Hugging Face поддерживает контролируемую тонкую настройку, обучение с подкреплением, оптимизацию предпочтений и моделирование вознаграждений. OpenEnv предоставляет стандартизированные среды для выполнения агентных задач. Open-R1 предлагает общие обучающие скрипты, наборы данных, инструменты оценки, конвейеры для работы с синтетическими данными и методики разработки, которые другие команды могут воспроизвести и адаптировать под свои нужды. В совокупности эти проекты показывают, что открытое пост-обучение — это уже не просто идея. Многие из его составляющих уже существуют, хотя им ещё предстоит объединиться в единый, широко распространённый и воспроизводимый стек разработки.
Сейчас приоритетной задачей является расширение доступности полноценных проектов пост-обучения, которые объединяют модели, наборы данных, среды, функции вознаграждения, инструменты оценки и экспериментальные данные в воспроизводимой форме. Такие проекты позволяют другим командам изучать процесс разработки, воспроизводить его результаты и адаптировать методы под другую модель или область. ПО с открытым исходным кодом стало базовой инфраструктурой именно благодаря такому накопительному эффекту.
Открытое пост-обучение не сделает разработку продвинутых моделей лёгкой. Организациям по-прежнему будут требоваться значительные вычислительные мощности, высококачественные данные, эксперты-оценщики, специализированные среды и технические знания для диагностики неудачных запусков обучения. Важность этого подхода заключается в том, что он позволяет разорвать замкнутый круг, в котором знания, необходимые для создания продвинутого ИИ, сосредоточены в небольшом количестве лабораторий.
Экосистема открытых моделей позволяет развиваться множеству видов ИИ
Открытые модели и анализ открытого пост-обучения раскрывают важную истину, которую часто скрывает нынешняя структура рынка: у ИИ нет единого направления развития. Передовые модели от OpenAI, Anthropic и Google представляют собой особую и коммерчески выгодную концепцию развития ИИ, в которой упор делается на программирование, математические и научные методы, широкий охват знаний и гибкую работу в различных областях. Эта концепция занимает важное место в более широком поле исследований в области ИИ. Но возможности, которым отдают приоритет несколько передовых лабораторий, не должны становиться универсальным стандартом, по которому оцениваются все ИИ-достижения.
Различные виды ИИ — это разные конфигурации знаний, восприятия, суждений и практических навыков, которые соответствуют разным стандартам совершенства. Научный ИИ выявляет закономерности в структуре белков или определяет перспективные направления в сложной области исследований. Инженерный ИИ учитывает физические ограничения, требования безопасности, эффективность и технологичность. Другие виды ИИ придают большее значение эстетическому суждению, внимательности, культурной компетентности, педагогике, вкусу или практической мудрости. Дизайнерский ИИ создает дом, отражающий воспоминания, потребности и повседневные ритмы людей, которые в нем живут. Культурный ИИ организует витрину книжного магазина, которая вызывает неожиданные ассоциации и приглашает к открытиям. Развивающий ИИ помогает семье выбрать медиа, подходящие для конкретного ребенка. Практический, или реляционный ИИ формирует семейный отдых, в котором сбалансированы финансовые аспекты, энергозатраты, доступность, конкурирующие интересы и впечатления, которые запомнятся разным людям.
Каждый из этих видов ИИ предполагает различное сочетание фактических знаний, восприятия, эмпатии, понимания контекста, технической компетентности и здравого смысла. Некоторые формы ИИ отдают предпочтение математической правильности, научной обоснованности или инженерной точности. Другие отдают предпочтение красоте, согласованности, заботе, приспособленности, доверию, удовольствию или пониманию того, что будет работать у конкретных людей в конкретных условиях. Система может превосходно соответствовать одному набору стандартов и оставаться непримечательной по сравнению с другим, даже если она демонстрирует высокие результаты по широкому кругу критериев.
Уважение к множественному ИИ остается совместимым со строгими стандартами достоверности, доказательности, компетентности, последовательности и совершенства. Различные точки зрения не стирают различия между правдой и ложью. Каждая форма ИИ должна соответствовать стандартам, соответствующим ее заявлениям и целям. Достоверный ИИ может принимать различные формы, служить различным целям и не поддаваться сведению к единой иерархии, определяемой эффективностью модели общего назначения.
Таким образом, рынок ИИ с многообразной структурой будет иметь множество научных, технических, культурных, коммерческих и практических аспектов. Поставщики услуг общего назначения будут продолжать конкурировать за широкий кругозор, надежность и качество управляемых услуг. Специализированные разработчики, учреждения и сообщества могли бы создавать возможности, основанные на знании предметной области, эстетических суждениях, культурных знаниях, практическом опыте и различных концепциях успеха. Экосистема открытых моделей дает этим формам ИИ возможность развиваться, проходить испытания и доказывать свою ценность — процветая или нет, на их собственных условиях.
Выбор между дефицитом и изобилием
По мере того как уровень моделей становится все более доступным, а разрыв в возможностях сокращается, передовые разработки будут все больше отличаться по эксплуатационным качествам, которые требуются предприятиям: предсказуемость, задержка, время безотказной работы, региональная доступность, безопасность и соответствие нормативным требованиям — все это зависит от уровня управления, которое может обеспечить только поставщик с хорошими ресурсами. Эти характеристики оправдывают масштабные корпоративные закупки и зависят от объема капиталовложений, доступа к вычислительным ресурсам и инвестиций в инфраструктуру, для поддержки которых у передовых лабораторий есть уникальные возможности. Открытые модели и многовалентные формы ИИ расширяют рынок, предоставляя возможность развивать дифференцированный потенциал более широкому кругу организаций, в то время как передовые поставщики конкурируют за предоставление надежных, управляемых систем общего назначения корпоративного масштаба. В результате возникает экономика ИИ с бóльшим количеством разработчиков, новыми формами интеллекта и усилением конкурентного давления на всех уровнях.
Споры об открытых моделях — это нечто большее, чем дискуссии о дистилляции или разногласия по поводу политики доступа. Они касаются того, останется ли возможность разрабатывать продвинутый ИИ в руках узкого круга поставщиков или же она станет более доступной, дешевой и будет охватывать весь спектр областей и организаций, которые в ней нуждаются. Запрет на открытые релизы сохранят дефицит в тот момент, когда начинают складываться условия для изобилия. Открытые модели — это основа. Открытое пост-обучение — это путь развития. От того, какое решение будет принято сейчас, зависит, какое будущее нас ждет.





























