Liquid AI представила две модели для принятия решений с открытыми весами: d1-3B работает с текстом и изображениями, а экспериментальная d1-omni-600M также поддерживает речь. Обе модели опубликованы на Hugging Face — их можно скачать, дообучить и развернуть самостоятельно, сообщает IT Home.

У d1-3B — 3,12 млрд параметров. В публичном наборе заданий Decision Index v0.2.1 модель набрала 48,57 балла; Liquid AI заявляет, что это лучший результат среди моделей с числом параметров менее 10 млрд. Более компактная d1-omni-600M содержит 587 млн параметров и принимает сочетания текста с изображением или текста с речью.

По данным Liquid AI, d1-3B отвечает на один вопрос за 8 мс на GeForce RTX 4090, но обработка изображения размером 384 пикселя занимает 102 мс. Пользовательский тест на GeForce RTX 3060 с 12 ГБ видеопамяти показал 25 мс на одно решение и 146 мс на изображение 640 × 480 пикселей. Пиковое потребление видеопамяти в этом тесте составило около 6 ГБ. Разница между временем ответа на вопрос и обработкой изображения важна: показатель 8 мс не описывает работу модели с картинкой.
Источник: IT Home.