Руководитель направления больших моделей Xiaomi Ло Фули представила архитектуру HySparse 2, которую компания собирается использовать в будущей MiMo-V3. По приведённым ею данным, при контексте в 1 млн токенов архитектура требует в 5,02 раза меньше вычислений на предварительную обработку запроса и в 4,5 раза меньший KV-кеш. О заявлении сообщило IT之家.

Предварительная обработка, или префилл, нужна модели, чтобы прочитать входной текст до начала ответа. KV-кеш хранит данные, к которым она обращается при дальнейшей работе с контекстом. Ло Фули объясняет задачу на примере ИИ-агента: короткое действие может вернуть большой объём текста, который придётся обработать, пока история взаимодействия продолжает расти.

Изображение к статье: Xiaomi представила HySparse 2 для будущей модели MiMo-V3

HySparse 2 сокращает эти затраты несколькими способами. Одна часть архитектуры строит данные для механизма внимания на основе уже полученных скрытых состояний, а разреженные слои повторно используют KV-кеш и результаты отбора токенов соседних слоёв. Архитектура также отбирает отдельные токены вместо целых блоков и сохраняет недавние токены в общем кеше. Подробнее устройство описано в публикации об HySparse 2.

Ло Фули также сообщила о более высоких результатах в тестах поиска информации в длинном контексте MRCRv2 и RULER-v2, но конкретные баллы в сообщении IT之家 не приведены. Сама MiMo-V3 пока заявлена как будущая модель: приведённые показатели относятся к её архитектуре, а не к тестированию готового сервиса.

Продолжение после рекламы

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.