
Что не так с "открытыми " китайскими моделями?
С публикацией моделей Kimi K3, Qwen 3.8 произошел тектонический сдвиг в индустрии искусственного интеллекта. Выход гигантских «открытых» моделей в конце лета 2026 года меняет расстановку сил на рынке, ставя под угрозу привычную бизнес-модель продажи токенов.
Однако при практическом рассмотрении мы приходим к неутешительному - локальный запуск модели Kimi K3 практически невозможен для большинства пользователей и организаций из-за колоссальных аппаратных требований, которые диктует математика её архитектуры.
Вот основные технические причины этого аппаратного тупика:
Гигантский размер и объем весов: Модель имеет беспрецедентные 2,8 триллиона параметров. Даже в уже сжатом виде с изначально 4-битной точностью файл весовых коэффициентов Kimi K3 весит около 1,4 терабайта.
Нехватка видеопамяти (VRAM): Один из самых мощных ускорителей NVIDIA H100 обладает всего 80 ГБ памяти. Чтобы просто загрузить файл модели в память (до того, как появится хотя бы один токен контекста), физически потребуется как минимум 18 видеокарт H100.
Особенности архитектуры MoE (Mixture of Experts): Kimi K3 построена по принципу смеси экспертов и содержит 896 отдельных экспертных подсетей. Хотя для обработки каждого токена активируется только 16 из них (что экономит вычислительную мощность), маршрутизатор может в любой момент направить токен к любому эксперту. Из-за этого все 896 экспертов должны постоянно находиться в быстрой видеопамяти — их физически невозможно подгружать с диска на лету.
Колоссальная стоимость инфраструктуры: Официальные рекомендации разработчика Moonshot по развертыванию Kimi K3 требуют конфигурации суперузлов, состоящей из 64 и более ускорителей. Стоимость только кремниевых компонентов для такой системы превышает 2 миллиона долларов, не говоря уже о межсоединениях и оплате труда инженеров, умеющих этим управлять.
Поэтому сильно вызывают сомнения следующие очевидные факты на которые в рекламе достижений не обращают внимания:
- Разница между «открытыми весами» ****(Open Weights) и открытым исходным кодом (Open Source).
- Подмена понятий: Медиа ошибочно называют новые сверхмодели (китайскую Kimi K3 на 2,8 трлн параметров и Qwen 3.8-Max от Alibaba на 2,4 трлн параметров) «открытым исходным кодом».
- Суть разрыва: Настоящий Open Source (как его определяет OSI) требует публикации не только весов, но и обучающего кода, а также детальной документации по данным, чтобы систему можно было воссоздать и изучить (как это делают Olmo и Molmo от Института Аллена). Kimi K3 и Qwen 3.8-Max это модели с открытыми весами (Open Weights). Они поставляются без технического отчета, без системной карты и со специальными коммерческими лицензиями (например, у Kimi K3 есть пункт о сборе роялти, если доход оператора превышает \$20 млн).
- Аппаратный тупик локального размещения
- Иллюзия автономности: Многие организации надеются разместить эти передовые модели на своих серверах для соблюдения безопасности данных, однако это физически невозможно для 99% компаний !!!.
- Суровая арифметика MoE: Сжатая до 4 бит модель Kimi K3 весит 1,4 терабайта. Из-за MoE-архитектуры (896 экспертных подсетей) все эксперты должны находиться в быстрой видеопамяти, так как маршрутизатор может выбрать любого из них для следующего токена.
- Стоимость запуска: Чтобы просто загрузить файл Kimi K3 в память, требуется минимум 18 видеокарт H100 (80 ГБ). Для стабильной работы Moonshot рекомендует конфигурацию из 64+ ускорителей, что обойдется компании более чем в \$2 млн только за чипы. Локальный запуск таких моделей это иллюзия; пользователям все равно придется арендовать чужие облака и передавать свои данные третьим лицам.
- Экономическая иллюзия: цена токена против стоимости задачи
- На бумаге аренда Kimi K3 кажется невероятно дешевой (\$3 за миллион входных и \$15 за миллион выходных токенов — вдвое дешевле GPT-5.6 Sol).
- Однако на практике модель тратит примерно вдвое больше токенов на выполнение одной и той же задачи, из-за чего реальная стоимость выполнения работы выравнивается и составляет те же ~\$4,70.
- Ситуация усугубляется крайне низкой скоростью генерации Kimi K3 (20–32 токена в секунду против 73 у Claude Fable 5), из-за чего сложные задачи могут выполняться часами.
4. В чем реальная ценность открытых весов?
- Полный контроль над валидацией: Главный плюс открытых весов — отсутствие «цензуры» и внешних классификаторов безопасности между пользователем и его запросами.
- В качестве примера можно рассмотреть инцидент в Hugging Face: когда система подверглась атаке ИИ, закрытые коммерческие модели отказались анализировать логи безопасности (их фильтры приняли запросы за хакерскую атаку). Проблему решила локальная китайская модель GLM-5.2, которая без ограничений обработала 17 тысяч событий безопасности за пару часов.
- Настоящий локальный ИИ это маленькие модели: Для большинства реальных производственных задач (классификация, извлечение данных, маршрутизация) идеально подходят сверхмалые модели вроде Gemma 3 4B (2,6 ГБ) или Phi-4-Mini (1,2 ГБ), которые легко запускаются на обычном ноутбуке.
5. Конец токеновой экономики и коммерческая стратегия
- Токеновый лом: Бизнес-модель, в которой несколько элитных лабораторий продают «интеллект» по цене программного обеспечения и забирают 90% прибыли, умирает. Выпуск открытых весов уровня K3 устанавливает жесткий ценовой потолок для закрытых лабораторий.
- Сдвиг ценности: Маржинальность вывода падает, превращая ИИ-генерацию в низкоприбыльную коммунальную услугу (как интернет-трафик или электросеть). Вся реальная прибыль и бизнес смещаются в смежные слои: оптимизацию инфраструктуры, тонкую настройку моделей под конкретные задачи, управление контекстом и владение уникальными данными клиентов.
- Коммодитизация сопутствующего товара: Выпуская триллионные модели бесплатно, Meta (с Llama) и китайские лаборатории (с Qwen) осознанно уничтожают маржинальность и бизнес-модель своих главных американских конкурентов (OpenAI, Anthropic), для которых продажа токенов — основной источник выживания.
- Наводняя рынок бесплатными весами, они создают глобальную технологическую зависимость и диктуют свои архитектурные и лицензионные стандарты (семейство Qwen уже преодолело отметку в 1 млрд загрузок).
Следить за этой борьбой Китая и мегаигроков из США очень интересно и будем надеятся что китайский подход к производству железа понизит порог стоимости для запуска локальных моделей в будущем , что сильно удешевит использование AI инструментов большинству технологических стартапов.


