Kimi K3 от пекинской Moonshot AI вышла в классе 2,8 трлн параметров и уже заняла первое место в Frontend Code Arena. Но главный нюанс простой: почти все цифры пока идут от самой компании, а полные веса обещаны только 27 июля 2026 года.

Moonshot называет K3 первой открытой системой 3T-класса и крупнейшей open-weight моделью из опубликованных. Формально это звучит громко. Практически — проверять такую заявку можно будет только после публикации весов.

Kimi K3 получила 1 млн токенов контекста и MoE на 896 экспертов

По данным Moonshot в техническом блоге Kimi K3, модель использует архитектуру Mixture-of-Experts: всего у нее 896 экспертов, но на каждый токен активируются только 16. Это около 1,8% от общего пула, поэтому число 2,8 трлн параметров не равно полной нагрузке на каждый запрос.

Продолжение после рекламы
  • Параметры: 2,8 трлн
  • Контекст: до 1 млн токенов
  • Эксперты: 896 всего, 16 активных на токен
  • Мультимодальность: есть нативное зрение
  • Полные веса: Moonshot обещает выложить 27 июля 2026 года

Цены на API тоже выросли относительно прошлого поколения. Ввод с попаданием в кэш стоит $0,30 за 1 млн токенов, около 30 рублей. Ввод без кэша — $3, около 300 рублей. Вывод дороже: $15 за 1 млн токенов, около 1 200 рублей.

Для сравнения, Kimi K2 год назад стартовала с $0,60 за 1 млн входных токенов, около 50 рублей. Некэшированный ввод у K3 выходит в пять раз дороже.

Бенчмарки сильные, но это еще не независимая картина

В Frontend Code Arena модель набрала 1 679 баллов и заняла первое место в слепом тестировании разработчиков. Moonshot отдельно признает, что в общей оценке K3 пока уступает Claude Fable 5 и GPT 5.6 Sol, но обходит ряд других флагманов в тестах кода и агентных задач.

Модель Что заявлено
Kimi K3 1 место в Frontend Code Arena, 1 679 баллов
Claude Fable 5 Выше K3 в общей оценке Moonshot, ниже в Frontend Code Arena
GPT 5.6 Sol Выше K3 в общей оценке Moonshot
Claude Opus 4.8 и GPT 5.5 Уступают K3 в наборе coding и agentic-бенчмарков Moonshot

Тут нужен холодный душ. Пока опубликованные результаты либо пришли от Moonshot, либо сняты через API. Без открытых весов сложно проверить воспроизводимость, настройки инференса и поведение модели вне выбранных тестов.

Изображение к статье: Kimi K3 на 2,8 трлн параметров обошла Claude в Arena

Есть и юридический фон. Anthropic в феврале обвинила Moonshot в использовании 3,4 млн обменов с Claude для обучения моделей через дистилляцию. K3 теперь показывает результаты рядом с моделями, которые фигурировали в той претензии. Это не доказывает источник качества, но делает независимую проверку еще важнее.

Архитектура Kimi K3 заточена под дорогой инференс

Moonshot связывает рост эффективности с двумя изменениями: Kimi Delta Attention и Attention Residuals. Первое — гибридная линейная схема внимания. Второе меняет перенос информации между слоями, чтобы большая модель лучше держала длинный контекст.

Обучение с учетом квантизации начинается уже на этапе supervised fine-tuning. Компания использует веса MXFP4 и активации MXFP8. Moonshot пишет, что выбрала такую пару ради совместимости с разным железом, а не только с одной линейкой ускорителей.

CNBC цитирует записку аналитиков Bank of America во главе с Алексом Лю. Они считают, что K3 показывает запас у крупных китайских моделей: масштабное предобучение и архитектурная работа все еще дают резкий прирост, даже при ограниченном доступе к топовым ускорителям.

Продолжение после рекламы

Железная часть выглядит не менее любопытно. В тесте оптимизации ядер Moonshot использовала Nvidia H200 и неназванный GPGPU от альтернативного поставщика. Компилятор MiniTriton, написанный для K3 с нуля, сравнили с Triton на Nvidia L20 — урезанной Ada-карте, которую продают в Китай по экспортным правилам США.

Для обслуживания K3 компания рекомендует суперузлы из 64 и более ускорителей. Идея понятная для MoE: трафик между экспертами лучше держать внутри одного домена с высокой пропускной способностью. Иначе сеть быстро съест часть выигрыша от редкой активации.

Автономный дизайн чипа за 48 часов

Moonshot привела отдельный кейс с автономной работой K3. Модель за один 48-часовой прогон спроектировала симулированный inference-чип для нано-модели на похожей архитектуре, используя open-source EDA-инструменты и библиотеку Nangate 45nm.

Проект закрыл тайминги на 100 МГц при площади до 4 мм². В дизайн вошли 1,46 млн стандартных ячеек и INT4 MAC-массив. В симуляции декодирования чип держал более 8 700 токенов в секунду.

Moonshot не раскрывает, где находились H200 во время тестов. Полные веса Kimi K3 компания обещает опубликовать 27 июля 2026 года.

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.