MWS Cloud (входит в МТС Web Services) проанализировала требования к вычислительной инфраструктуре для запуска ведущих мировых и российских больших языковых моделей. По оценке компании, средняя стоимость минимального набора ускорителей Nvidia для запуска одной модели выросла с 13,7 млн. рублей в 2025 году до 38,8 млн. рублей в 2026 году — в 2,8 раза.
В анализ вошли популярные открытые модели, выпущенные весной и летом соответствующего года. Для 2025 года рассматривались Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и российская Cotype Pro 2. Для 2026 года — Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3.
Расчёт сделан для минимального количества видеокарт, необходимого для запуска модели и обработки одного запроса максимального заявленного размера. В стоимость включены серверы с GPU и коммутаторы к ним.
|
Год |
Наиболее популярный GPU |
Другие GPU |
|
2025 |
H100 — для трёх из шести моделей |
H200 — для двух моделей; A100 — для одной |
|
2026 |
H200 — для трёх из семи моделей |
B300 — для двух моделей; H100 и A100 — ещё для двух |
Рейтинг моделей по стоимости запуска в 2025 году
|
Место |
Модель |
Количество параметров |
Минимальная конфигурация |
Стоимость |
|
1 |
Kimi K2 |
1 трлн (32 млрд. активных) |
8 × H200 141 Гб |
примерно 35 млн. рублей |
|
2 |
Qwen3 |
235 млрд. (22 млрд. активных) |
4 × H200 141 Гб |
примерно 18 млн. рублей |
|
3 |
GLM-4.5V |
106 млрд. (12 млрд. активных) |
минимум 4 × H100 80 Гб |
примерно 15 млн. рублей |
|
4 |
Gemma 3 |
27 млрд |
2 × H100 80 Гб |
примерно 7,5 млн. рублей |
|
5 |
gpt-oss |
117 млрд. (5,1 млрд. активных) |
1 × H100 80 Гб |
более 3,5 млн. рублей |
|
6 |
Cotype Pro 2 |
32 млрд |
1 × A100 80 Гб |
примерно 3 млн. рублей |
Рейтинг моделей по стоимости запуска в 2026 году
|
Место |
Модель |
Количество параметров |
Минимальная конфигурация |
Стоимость |
|
1 |
Kimi K3 |
2,8 трлн (104 млрд. активных) |
8 × B300 288 Гб |
примерно 80 млн. рублей |
|
2 |
Qwen3.5 |
397 млрд. (17 млрд. активных) |
8 × H200 141 Гб |
примерно 55 млн. рублей |
|
2 |
DeepSeek-V4-Pro |
1,6 трлн (49 млрд. активных) |
8 × H200 141 Гб |
примерно 55 млн. рублей |
|
2 |
GLM-5.2 |
744 млрд. (около 40 млрд. активных) |
8 × H200 141 Гб |
примерно 55 млн. рублей |
|
5 |
DeepSeek-V4-Flash |
284 млрд. (13 млрд. активных) |
1 × B300 288 Гб |
примерно 10 млн. рублей |
|
6 |
Gemma 4 |
31 млрд |
2 × H100 80 Гб |
примерно 7,5 млн. рублей |
|
7 |
Cotype Pro 3 |
27 млрд |
1 × A100 80 Гб |
примерно 3 млн. рублей |
Новые LLM становятся более мощными: они лучше справляются со сложными задачами и могут учитывать больше информации в одном запросе. Однако для этого им требуется больше памяти и более производительные GPU. При этом растёт и стоимость самих видеокарт, поэтому развёртывание моделей обходится дороже.
Отдельно MWS Cloud оценила возможные конфигурации на китайских ускорителях Huawei Ascend 910B. Возможность запуска на них подтверждена не для всех рассмотренных LLM: в выборке 2025 года подтверждение есть для трёх из шести моделей, в 2026 году — для пяти из семи.
Среди моделей с подтверждённой или экспериментально подтверждённой поддержкой Huawei в 2025 году в среднем требовалось 10,7 ускорителя Ascend 910B, а в 2026 году — 13,6. Официальной цены на данные GPU нет, но, по оценкам, она может составлять от половины до двух третей стоимости сопоставимых GPU Nvidia.
«Цены на GPU в России во многом зависят от мирового рынка: глобальная гонка в области ИИ увеличивает спрос на вычислительные мощности и поддерживает рост стоимости ускорителей. По данным исследования MWS Cloud, 47% респондентов ожидают удорожания GPU-ресурсов в ближайшие 12 месяцев, а 45% считают, что их значение для бизнеса будет расти. Развёртывать крупные модели на собственной инфраструктуре становится дороже, однако единого ценового предела, после которого рынок потеряет интерес к ИИ, нет: если покупка оборудования перестаёт окупаться, компании выбирают более компактные модели, оптимизируют вычисления или переходят в облако, где можно платить только за фактически используемые мощности. Один из индикаторов этого сдвига — рост облачного потребления ИИ-моделей: по оценке MWS Cloud, в первом полугодии 2026 года потребление китайских LLM российскими компаниями на платформах MWS GPT Model Hub и MWS GPT более чем в 11 раз превысило показатель за весь 2025 год», — отметил генеральный директор MWS Павел Воронин





























