Содержание
Kimi K3 от пекинской Moonshot AI вышла в классе 2,8 трлн параметров и уже заняла первое место в Frontend Code Arena. Но главный нюанс простой: почти все цифры пока идут от самой компании, а полные веса обещаны только 27 июля 2026 года.
Moonshot называет K3 первой открытой системой 3T-класса и крупнейшей open-weight моделью из опубликованных. Формально это звучит громко. Практически — проверять такую заявку можно будет только после публикации весов.
Kimi K3 получила 1 млн токенов контекста и MoE на 896 экспертов
По данным Moonshot в техническом блоге Kimi K3, модель использует архитектуру Mixture-of-Experts: всего у нее 896 экспертов, но на каждый токен активируются только 16. Это около 1,8% от общего пула, поэтому число 2,8 трлн параметров не равно полной нагрузке на каждый запрос.
- Параметры: 2,8 трлн
- Контекст: до 1 млн токенов
- Эксперты: 896 всего, 16 активных на токен
- Мультимодальность: есть нативное зрение
- Полные веса: Moonshot обещает выложить 27 июля 2026 года
Цены на API тоже выросли относительно прошлого поколения. Ввод с попаданием в кэш стоит $0,30 за 1 млн токенов, около 30 рублей. Ввод без кэша — $3, около 300 рублей. Вывод дороже: $15 за 1 млн токенов, около 1 200 рублей.
Для сравнения, Kimi K2 год назад стартовала с $0,60 за 1 млн входных токенов, около 50 рублей. Некэшированный ввод у K3 выходит в пять раз дороже.
Бенчмарки сильные, но это еще не независимая картина
В Frontend Code Arena модель набрала 1 679 баллов и заняла первое место в слепом тестировании разработчиков. Moonshot отдельно признает, что в общей оценке K3 пока уступает Claude Fable 5 и GPT 5.6 Sol, но обходит ряд других флагманов в тестах кода и агентных задач.
| Модель | Что заявлено |
|---|---|
| Kimi K3 | 1 место в Frontend Code Arena, 1 679 баллов |
| Claude Fable 5 | Выше K3 в общей оценке Moonshot, ниже в Frontend Code Arena |
| GPT 5.6 Sol | Выше K3 в общей оценке Moonshot |
| Claude Opus 4.8 и GPT 5.5 | Уступают K3 в наборе coding и agentic-бенчмарков Moonshot |
Тут нужен холодный душ. Пока опубликованные результаты либо пришли от Moonshot, либо сняты через API. Без открытых весов сложно проверить воспроизводимость, настройки инференса и поведение модели вне выбранных тестов.
Есть и юридический фон. Anthropic в феврале обвинила Moonshot в использовании 3,4 млн обменов с Claude для обучения моделей через дистилляцию. K3 теперь показывает результаты рядом с моделями, которые фигурировали в той претензии. Это не доказывает источник качества, но делает независимую проверку еще важнее.
Архитектура Kimi K3 заточена под дорогой инференс
Moonshot связывает рост эффективности с двумя изменениями: Kimi Delta Attention и Attention Residuals. Первое — гибридная линейная схема внимания. Второе меняет перенос информации между слоями, чтобы большая модель лучше держала длинный контекст.
Обучение с учетом квантизации начинается уже на этапе supervised fine-tuning. Компания использует веса MXFP4 и активации MXFP8. Moonshot пишет, что выбрала такую пару ради совместимости с разным железом, а не только с одной линейкой ускорителей.
CNBC цитирует записку аналитиков Bank of America во главе с Алексом Лю. Они считают, что K3 показывает запас у крупных китайских моделей: масштабное предобучение и архитектурная работа все еще дают резкий прирост, даже при ограниченном доступе к топовым ускорителям.
Железная часть выглядит не менее любопытно. В тесте оптимизации ядер Moonshot использовала Nvidia H200 и неназванный GPGPU от альтернативного поставщика. Компилятор MiniTriton, написанный для K3 с нуля, сравнили с Triton на Nvidia L20 — урезанной Ada-карте, которую продают в Китай по экспортным правилам США.
Для обслуживания K3 компания рекомендует суперузлы из 64 и более ускорителей. Идея понятная для MoE: трафик между экспертами лучше держать внутри одного домена с высокой пропускной способностью. Иначе сеть быстро съест часть выигрыша от редкой активации.
Автономный дизайн чипа за 48 часов
Moonshot привела отдельный кейс с автономной работой K3. Модель за один 48-часовой прогон спроектировала симулированный inference-чип для нано-модели на похожей архитектуре, используя open-source EDA-инструменты и библиотеку Nangate 45nm.
Проект закрыл тайминги на 100 МГц при площади до 4 мм². В дизайн вошли 1,46 млн стандартных ячеек и INT4 MAC-массив. В симуляции декодирования чип держал более 8 700 токенов в секунду.
Moonshot не раскрывает, где находились H200 во время тестов. Полные веса Kimi K3 компания обещает опубликовать 27 июля 2026 года.