DeepSeek и другие китайские ИИ: какие модели выбрать и сколько они стоят
Китайские лаборатории DeepSeek, Alibaba, Moonshot AI и Zhipu AI выпустили линейки языковых моделей, доступ к которым через API стоит в разы дешевле, чем у OpenAI, Anthropic и Google. Разбираемся, сколько стоят самые заметные из них, чем они отличаются технически и кому подойдет каждая.
DeepSeek
Компания из Хангчжоу предлагает две основные модели — DeepSeek-V4-Flash и DeepSeek-V4-Pro. Обе поддерживают контекстное окно в один миллион токенов, максимальный размер ответа до 384 000 токенов и переключаемый режим рассуждений.
V4-Flash стоит $0,22 за один миллион входных токенов и $0,66 за один миллион выходных. При попадании во внутренний кэш цена входных токенов падает до $0,007 — это самый дешевый вариант среди всех моделей в обзоре. V4-Pro обходится в $0,66 за один миллион входных токенов и $1,98 за один миллион выходных.
Модель поддерживает вызов инструментов, структурированный вывод в формате JSON и работу через интерфейсы, совместимые с OpenAI и Anthropic. В начале августа 2026 года DeepSeek предупредила разработчиков о готовящемся существенном повышении цен, не раскрыв точных цифр и даты.
Кому подойдет: разработчикам, которым важна максимально низкая цена входных токенов при большом объеме запросов — классификация текста, извлечение данных, пакетная обработка.
Qwen от Alibaba Cloud
Флагманская линейка Qwen доступна через платформу Alibaba Cloud Model Studio, ранее известную как DashScope. Модель Qwen3.7-Max с контекстным окном в один миллион токенов по действующей акции стоит $2,5 за один миллион входных токенов и $7,5 за один миллион выходных — при базовой цене $5 и $15 соответственно.
Бюджетная линейка Qwen-Flash стоит от $0,05 за один миллион входных токенов и $0,4 за один миллион выходных для запросов до 256 000 токенов — цена растет при более длинных запросах. Специализированная модель для разработки Qwen3-Coder-Plus стоит от $1 за один миллион входных токенов до $6 при запросах длиннее 256 000 токенов.
Важная особенность Alibaba Cloud — цены зависят от региона развертывания. Тарифы для сингапурского дата-центра, который используют большинство разработчиков за пределами Китая, заметно выше внутрикитайских: например, Qwen-Plus в Пекине обходится примерно втрое дешевле, чем в Сингапуре.
Часть моделей семейства — включая Qwen3, Qwen3.5 и Qwen3-Coder — выпущена с открытыми весами по лицензии Apache 2.0, что позволяет развернуть их на собственных серверах без оплаты по токенам.
Кому подойдет: командам, которым нужна гибкость между облачным API и локальным развертыванием, а также проектам с мультимодальными задачами — у Qwen отдельные модели для распознавания изображений, аудио и видео.
Kimi от Moonshot AI
Пекинская Moonshot AI развивает линейку Kimi. Актуальный флагман Kimi K3 вышел 16 июля 2026 года — это модель на 2,8 триллиона параметров с контекстным окном в 1 048 576 токенов, постоянно работающая в режиме рассуждений с настраиваемой глубиной через параметр reasoning_effort.
По данным официальной документации платформы, K3 стоит $3 за один миллион входных токенов при промахе кэша, $15 за один миллион выходных токенов и всего $0,30 за один миллион входных токенов при попадании в кэш. Moonshot заявляет, что при типичных задачах разработки доля попаданий в кэш превышает 90%, то есть реальная стоимость входных токенов на практике оказывается заметно ближе к $0,30, чем к $3.
Более доступные модели линейки — Kimi K2.6 и специализированная для кода Kimi K2.7 Code — стоят $0,95 за один миллион входных токенов и $4 за один миллион выходных при контекстном окне в 262 144 токена. Веса K3 опубликованы в открытом доступе 26 июля 2026 года, что дает возможность самостоятельного развертывания при наличии соответствующей инфраструктуры.
Кому подойдет: командам, работающим с большими кодовыми базами и агентными сценариями, где модель многократно обращается к одному и тому же контексту — именно там кеширование дает наибольшую экономию.
GLM от Z.ai
Пекинская Zhipu AI, работающая на международном рынке под брендом Z.ai, предлагает линейку GLM. Актуальная флагманская модель GLM-5.2 стоит $1,4 за один миллион входных токенов и $4,4 за один миллион выходных, при этом закешированные входные токены обходятся всего в $0,26 за один миллион. Модель поддерживает контекстное окно до одного миллиона токенов.
Более ранняя GLM-4.6 стоит $0,6 за один миллион входных токенов и $2,2 за один миллион выходных, а облегченная GLM-4.5-Air — $0,2 и $1,1 соответственно. Отдельно Z.ai предлагает две полностью бесплатные модели — GLM-4.7-Flash и GLM-4.5-Flash, доступные через API без оплаты за токены, хотя и с ограничениями по скорости и глубине рассуждений.
Как и Qwen, флагманские модели GLM выпускаются с открытыми весами по лицензии MIT, что дает возможность самостоятельного развертывания даже для топовых версий — редкий случай среди разработчиков крупных моделей.
Кому подойдет: проектам с ограниченным бюджетом, где часть задач можно закрыть бесплатными моделями, а более сложные — направить на платный флагман.
Что важно учитывать
Цены на всех перечисленных платформах меняются часто. Перед началом работы с любой из моделей стоит свериться с официальной страницей тарифов, а не ориентироваться на цифры из статьи трехмесячной давности.
