Liquid AI представила две модели для принятия решений с открытыми весами: d1-3B работает с текстом и изображениями, а экспериментальная d1-omni-600M также поддерживает речь. Обе модели опубликованы на Hugging Face — их можно скачать, дообучить и развернуть самостоятельно, сообщает IT Home.

Изображение к статье: Liquid AI открыла модели d1 для оценки текста, изображений и речи

У d1-3B — 3,12 млрд параметров. В публичном наборе заданий Decision Index v0.2.1 модель набрала 48,57 балла; Liquid AI заявляет, что это лучший результат среди моделей с числом параметров менее 10 млрд. Более компактная d1-omni-600M содержит 587 млн параметров и принимает сочетания текста с изображением или текста с речью.

Изображение к статье: Liquid AI открыла модели d1 для оценки текста, изображений и речи

По данным Liquid AI, d1-3B отвечает на один вопрос за 8 мс на GeForce RTX 4090, но обработка изображения размером 384 пикселя занимает 102 мс. Пользовательский тест на GeForce RTX 3060 с 12 ГБ видеопамяти показал 25 мс на одно решение и 146 мс на изображение 640 × 480 пикселей. Пиковое потребление видеопамяти в этом тесте составило около 6 ГБ. Разница между временем ответа на вопрос и обработкой изображения важна: показатель 8 мс не описывает работу модели с картинкой.

Источник: IT Home.

Продолжение после рекламы

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.