JetBrains выпустила ИИ-модель Mellum2.1, сосредоточив обновление на задачах, где модель работает с кодом в несколько шагов: изучает проект, правит файлы и проверяет результат. По сообщению IT Home, компания связывает улучшение прежде всего с изменениями в обучении после предварительной подготовки модели.

Изображение к статье: JetBrains выпустила Mellum2.1 для задач программирования

В Mellum2.1 обучение с подкреплением стало основной частью этого этапа, а не короткой завершающей стадией. JetBrains добавила задания по математике, алгоритмам, использованию инструментов и разработке ПО. Для обучения команда запускала миллионы изолированных сред; до него отсеяла из открытых наборов задания с ошибочными тестами и ответы, которые нельзя проверить. Компания утверждает, что модель лучше справляется с поиском причины упавшего теста, подготовкой исправления и его проверкой.

Изображение к статье: JetBrains выпустила Mellum2.1 для задач программирования

Архитектура осталась такой же, как у Mellum2: модель содержит 12 млрд параметров, из которых при работе задействовано 2,5 млрд. В сравнении, проведённом JetBrains при одинаковых настройках оценки, пропускная способность Mellum2.1 при высокой нагрузке приблизилась к двукратной относительно Qwen3.5-9B. Для одного запроса компания также сообщает об ускорении примерно в 1,6 раза благодаря предсказанию нескольких токенов за шаг. Это разные условия измерения скорости.

Mellum2.1 уже размещена на Hugging Face под лицензией Apache 2.0. Её можно разворачивать на собственной инфраструктуре, сохраняя код и данные в своей среде. Версии в формате GGUF для llama.cpp, Ollama и LM Studio, а также компонент для работы с vLLM JetBrains планирует выпустить позже.

Продолжение после рекламы

Источник: IT Home.

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.