MWS Cloud (входит в МТС Web Services) проанализировала требования к вычислительной инфраструктуре для запуска ведущих мировых и российских больших языковых моделей. По оценке компании, средняя стоимость минимального набора ускорителей Nvidia для запуска одной модели выросла с 13,7 млн. рублей в 2025 году до 38,8 млн. рублей в 2026 году — в 2,8 раза.

В анализ вошли популярные открытые модели, выпущенные весной и летом соответствующего года. Для 2025 года рассматривались Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и российская Cotype Pro 2. Для 2026 года — Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3.

Расчёт сделан для минимального количества видеокарт, необходимого для запуска модели и обработки одного запроса максимального заявленного размера. В стоимость включены серверы с GPU и коммутаторы к ним.

Год

Наиболее популярный GPU

Другие GPU

2025

H100 — для трёх из шести моделей

H200 — для двух моделей; A100 — для одной

2026

H200 — для трёх из семи моделей

B300 — для двух моделей; H100 и A100 — ещё для двух

Рейтинг моделей по стоимости запуска в 2025 году

Место

Модель

Количество параметров

Минимальная конфигурация

Стоимость

1

Kimi K2

1 трлн (32 млрд. активных)

8 × H200 141 Гб

примерно 35 млн. рублей

2

Qwen3

235 млрд. (22 млрд. активных)

4 × H200 141 Гб

примерно 18 млн. рублей

3

GLM-4.5V

106 млрд. (12 млрд. активных)

минимум 4 × H100 80 Гб

примерно 15 млн. рублей

4

Gemma 3

27 млрд

2 × H100 80 Гб

примерно 7,5 млн. рублей

5

gpt-oss

117 млрд. (5,1 млрд. активных)

1 × H100 80 Гб

более 3,5 млн. рублей

6

Cotype Pro 2

32 млрд

1 × A100 80 Гб

примерно 3 млн. рублей

Рейтинг моделей по стоимости запуска в 2026 году

Место

Модель

Количество параметров

Минимальная конфигурация

Стоимость

1

Kimi K3

2,8 трлн (104 млрд. активных)

8 × B300 288 Гб

примерно 80 млн. рублей

2

Qwen3.5

397 млрд. (17 млрд. активных)

8 × H200 141 Гб

примерно 55 млн. рублей

2

DeepSeek-V4-Pro

1,6 трлн (49 млрд. активных)

8 × H200 141 Гб

примерно 55 млн. рублей

2

GLM-5.2

744 млрд. (около 40 млрд. активных)

8 × H200 141 Гб

примерно 55 млн. рублей

5

DeepSeek-V4-Flash

284 млрд. (13 млрд. активных)

1 × B300 288 Гб

примерно 10 млн. рублей

6

Gemma 4

31 млрд

2 × H100 80 Гб

примерно 7,5 млн. рублей

7

Cotype Pro 3

27 млрд

1 × A100 80 Гб

примерно 3 млн. рублей

Новые LLM становятся более мощными: они лучше справляются со сложными задачами и могут учитывать больше информации в одном запросе. Однако для этого им требуется больше памяти и более производительные GPU. При этом растёт и стоимость самих видеокарт, поэтому развёртывание моделей обходится дороже.

Отдельно MWS Cloud оценила возможные конфигурации на китайских ускорителях Huawei Ascend 910B. Возможность запуска на них подтверждена не для всех рассмотренных LLM: в выборке 2025 года подтверждение есть для трёх из шести моделей, в 2026 году — для пяти из семи.

Среди моделей с подтверждённой или экспериментально подтверждённой поддержкой Huawei в 2025 году в среднем требовалось 10,7 ускорителя Ascend 910B, а в 2026 году — 13,6. Официальной цены на данные GPU нет, но, по оценкам, она может составлять от половины до двух третей стоимости сопоставимых GPU Nvidia.

«Цены на GPU в России во многом зависят от мирового рынка: глобальная гонка в области ИИ увеличивает спрос на вычислительные мощности и поддерживает рост стоимости ускорителей. По данным исследования MWS Cloud, 47% респондентов ожидают удорожания GPU-ресурсов в ближайшие 12 месяцев, а 45% считают, что их значение для бизнеса будет расти. Развёртывать крупные модели на собственной инфраструктуре становится дороже, однако единого ценового предела, после которого рынок потеряет интерес к ИИ, нет: если покупка оборудования перестаёт окупаться, компании выбирают более компактные модели, оптимизируют вычисления или переходят в облако, где можно платить только за фактически используемые мощности. Один из индикаторов этого сдвига — рост облачного потребления ИИ-моделей: по оценке MWS Cloud, в первом полугодии 2026 года потребление китайских LLM российскими компаниями на платформах MWS GPT Model Hub и MWS GPT более чем в 11 раз превысило показатель за весь 2025 год», — отметил генеральный директор MWS Павел Воронин