За $200 (около 20 000 рублей) энтузиаст собрал рабочую Nvidia Tesla V100 под обычный слот PCIe x16 и прогнал локальные LLM. В тестах YouTube-канала Hardware Haven серверная карта 2017 года местами обошла свежие потребительские GPU по скорости инференса и даже по эффективности.

История простая: старый датацентровый ускоритель с редким разъёмом, переходник, самодельное охлаждение и немного терпения. Получился «AI-комбайн» без видеовыходов, зато с 16 ГБ HBM2 и сильной софт-поддержкой Nvidia в популярных тулзах для LLM.

Что именно переделали: SMX2-ускоритель превратили в PCIe-карту

В основе сборки — Nvidia Tesla V100 в исполнении для серверов с интерфейсом SMX2. Это mezzanine-коннектор: GPU ставят плоско на базовую плату и фиксируют винтами, по ощущениям это ближе к «сокету», чем к привычной видеокарте.

Продолжение после рекламы

Автор купил сам модуль V100 за $100 (около 10 000 рублей) и ещё примерно за $100 (около 10 000 рублей) взял адаптер SMX-to-PCIe x16. Итого — те самые $200 за возможность воткнуть датацентровый ускоритель в потребительскую материнку.

Конкретно в тестах использовали версию с 16 ГБ HBM2 и пропускной способностью памяти 900 ГБ/с. Встречаются варианты на 32 ГБ, но они заметно дороже.

Охлаждение на 3D-принтере и нюансы питания

Изображение к статье: Энтузиаст переделал Tesla V100 в PCIe за $200 и прогнал LLM

Переходник сам по себе не решал вопрос охлаждения. У V100 в таком формате нет привычного кожуха, это фактически «радиатор на плате», который в стойке продувают мощные серверные вентиляторы.

Поэтому автор спроектировал и напечатал на 3D-принтере воздуховод, а на край поставил 80-мм вентилятор Noctua, чтобы тянуть воздух через радиатор. На адаптере есть 2x 8-pin PCIe для питания и 3 разъёма 4-pin PWM под вентиляторы.

Ещё один момент: у этой платы нет второго SMX-разъёма под NVLink. Варианты с NVLink существуют, но стоят заметно дороже.

Бенчмарки LLM: V100 обошла RX 7800 XT и RTX 3060

После установки в систему на Ryzen ускоритель прогнали в нескольких сценариях. Важно: у Tesla V100 нет видеовыходов, так что для «обычного ПК» нужен процессор со встроенной графикой, иначе картинку выводить будет нечем.

В Ollama с моделью gpt-oss-20b V100 выдала 130 токенов/с. Для сравнения, Radeon RX 7800 XT в системе автора показала около 90 токенов/с. И это при том, что у обеих карт по 16 ГБ видеопамяти.

Дальше сравнили с GeForce RTX 3060 12 GB как с более близким по экосистеме вариантом Nvidia. На gemma4: e4b V100 упёрлась в 108 токенов/с, а RTX 3060 — в 76 токенов/с.

Изображение к статье: Энтузиаст переделал Tesla V100 в PCIe за 0 и прогнал LLM

Эффективность: токены на ватт и лимиты мощности

По энергопотреблению «в лоб» расклад такой: 293 Вт у V100 против 235 Вт у RTX 3060 в том же тесте. В пересчёте на эффективность это около 0,37 ток/с на ватт у V100 и 0,33 ток/с на ватт у 3060.

Продолжение после рекламы

Но интереснее получилась история с power limit. При ограничении V100 до «100 Вт» фактическое потребление в тесте упало до 170 Вт, а скорость осталась на уровне 95 токенов/с. RTX 3060 при лимите «100 Вт» потребляла 171 Вт и выдавала 68 токенов/с.

  • Tesla V100 (лимит): 0,55 ток/с на ватт
  • RTX 3060 12 GB (лимит): 0,39 ток/с на ватт

При этом у V100 выше потребление в простое: 45 Вт против 35 Вт у RTX 3060.

Практика: Frigate NVR и «собака нашлась сразу»

Кроме LLM автор проверил ускоритель в Frigate NVR и получил более высокую производительность, чем на RTX 3060, но с ожидаемо большим расходом энергии.

Раньше у него работал мини-ПК на Intel N100, и тот «плохо видел» собаку на mobilenetv2. V100 распознавала объект сразу, но при мониторинге двух камер потребляла более 100 Вт. RTX 3060 в похожем сценарии вела себя сопоставимо, а N100 укладывался в 26 Вт при работе с шестью камерами.

По ценам на вторичке разброс уже заметен: сам автор нашёл V100 16 ГБ за $100, а версия V100 32 ГБ у продавцов доходит до $500 (около 40 000 рублей).

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.