Содержание
Tenstorrent на своём TT-Deploy livestream показала серверы Galaxy Blackhole и заявила, что на режиме Blitz Mode они выдают 350+ токенов/с на пользователя в DeepSeek-R1-0528 671B. Параллельно компания сравнила экономику с ускорителями NVIDIA GB300 и заявила про пятикратную разницу в AI TCO.
Тон у презентации был максимально боевой. Джим Келлер прямо сказал, что Tenstorrent собирается «crush everyone at everything, including AI» — «раздавить всех во всём, включая ИИ».
Galaxy Blackhole делает ставку на систему целиком, а не на одну плату
Tenstorrent подаёт Galaxy Blackhole как «полностью сетевое» и нативное AI-решение. В одной связке идут вычисления, память и сеть. Компания говорит, что собирала систему под современные AI-нагрузки, а не как универсальный сервер с ускорителем «в придачу».
Внутри Galaxy стоит чип Blackhole на архитектуре RISC-V. Tenstorrent позиционирует RISC-V как конкурента ARM и x86. Джим Келлер на стриме уточнил, что кремний ревизии A0 уже отгружается, но в софте пока чинят баги.
Ключевой вычислительный блок Tenstorrent называет Tensix. По описанию компании, это «tensor core», где работают пять RISC-процессоров. У них есть матричные блоки, векторные блоки и локальная SRAM. Каждый RISC-процессор программируется, а каждый core подключён к высокоскоростному NOC. Из набора таких Tensix-«ядер» и собирают чип.
350+ токенов/с в DeepSeek R1 и «премиальный» Blitz Mode
Главный бенчмарк презентации — демонстрация Blitz Mode на Galaxy Blackhole. Tenstorrent описывает его как режим для «премиальных» и чувствительных к задержке AI-нагрузок. В этой конфигурации компания показала 350+ tokens/s/user на модели DeepSeek-R1-0528 671B, причём речь шла о запуске на 16 Galaxy servers.
- Decode: DeepSeek-R1-0528 671B до 350+ токенов/с на пользователя; компания заявила, что это быстрее «самых быстрых inference-систем» от Groq и Cerebras, с поддержкой batch size от 8 до 64 и контекстом до 128K (на 16 серверах Galaxy).
- Prefill: DeepSeek-R1-0528 671B с time-to-first-token менее 4 секунд на 100K контекста, на тех же «универсальных» Galaxy superclusters.
Ещё один показательный кусок — генерация видео. Tenstorrent заявила, что её Galaxy Supercluster даёт до 10x ускорение в Video GenAI. В демо система сгенерировала 81 кадр (720p) за 2,4 секунды. Компания подала это как «5-секундное видео за 2,4 секунды», то есть быстрее реального времени.
Если хочется посмотреть первоисточник демонстрации, вот запись: TT-Deploy livestream.
Сравнение с NVIDIA GB300: упор на стоимость токена и TCO
В сравнении с конкурентами Tenstorrent целится прямо в боль корпоративных заказчиков — цену инференса. Компания утверждает, что на конкурирующих GPU-платформах (в качестве примера назвали NVIDIA GB300) рост пропускной способности по токенам часто достигают ценой снижения числа пользователей. Tenstorrent заявляет, что у Galaxy такого компромисса нет.
Ещё один тезис — «стоимость токена». Tenstorrent озвучила $6 против примерно $30 у конкурентов. И на этом основании компания заявила про значительно более низкий TCO и даже про «5x AI TCO» в сравнении с GB300. Это именно позиционирование Tenstorrent со сцены, без раскрытия методики расчёта в этих данных.
Цена и конфигурации: от $110 000 за сервер
Tenstorrent назвала стартовую цену $110 000 (около 9 млн рублей) за Galaxy Blackhole в стойке с воздушным охлаждением. Компания подчёркивает «полностью open-source software stack» для этой платформы.
- FP8-производительность: 23 PFLOPs
- Чипы: 32 Blackhole
- On-chip SRAM: 6,2 ГБ при 2,9 PB/s
- DRAM: 1 ТБ при 16 TB/s
- Сеть: 56 портов 800G Ethernet и до 11,2 GB/s scale-out bandwidth
Для тех, кто покупает «пачками», Tenstorrent предложила supercluster-конфигурации от 4 до 36 серверов. Базовый вариант на 4 Galaxy servers стартует с $440 000 (около 36 млн рублей).
Страница железа у Tenstorrent: Galaxy servers.