Содержание
Google разрабатывает серверный чип Frozen v2 для Gemini, который может выдавать в 6-10 раз больше токенов на ватт, чем новейшие TPU компании. Проект пока не анонсировали публично, но The Information узнало о нём от двух людей с прямым доступом к разработке.
Срок, который называют внутри проекта, — не раньше 2028 года. И это не случайная дата из презентации. По данным собеседников The Information, Google столкнулась с дефицитом AI-вычислений. Масштаб такой, что Google Cloud уже отказывала внешним клиентам в сделках.
Угол тут простой: мы видим не очередной универсальный ускоритель, а попытку зашить часть логики Gemini прямо в кремний. Для дата-центров это может быть тем же, чем ASIC стал для майнинга: меньше гибкости, зато выше эффективность в конкретной задаче.
Frozen v2 фиксирует архитектуру Gemini, но не веса модели
Frozen v2 отличается от обычного TPU тем, что часть решений модели Gemini инженеры хотят закрепить на уровне транзисторов. Обычный TPU, как и GPU, исполняет модель, которую в него загрузили. Железо тратит время и энергию на решения во время выполнения запроса.
Если часть архитектуры уже лежит в кремнии, чип делает меньше шагов. Он реже гоняет данные туда-сюда между блоками. Для инференса это критично: каждый лишний перенос данных жрёт энергию и добавляет задержку.
Один из собеседников The Information сказал, что такой подход может снизить задержку ответа. Это открывает дорогу приложениям, где важна не только цена токена, но и скорость реакции.
Первая версия Frozen шла дальше. Проект, которым занимался главный научный сотрудник Google DeepMind Джефф Дин, предполагал зашить в чип сами веса Gemini. Google отказалась от идеи, потому что такой кристалл быстро устарел бы после смены версии модели.
Frozen v2 выбирает более осторожный вариант: архитектура фиксируется, веса остаются обновляемыми. Но ограничение никуда не исчезает. Чип будет полезен только до тех пор, пока Google строит новые версии Gemini на той же базовой архитектуре.
Чем Frozen v2 отличается от TPU и специализированных чипов
Google не планирует выпускать Frozen v2 в объёмах обычных TPU. Компания рассматривает это поколение как испытание более узкого кремния, пока архитектуры больших моделей становятся стабильнее.
Ниже — сухое сравнение по тем данным, которые уже есть в открытой части истории.
| Чип | Подход | Гибкость | Заявленные или ожидаемые параметры |
|---|---|---|---|
| Google TPU | Универсальный ускоритель для загруженных моделей | Высокая | База сравнения для Frozen v2 |
| Google Frozen v2 | Часть архитектуры Gemini зашита в кремний | Средняя | В 6-10 раз больше токенов на ватт, цель — 2028 год |
| Taalas HC1 | Llama 3.1 8B постоянно зашита в кристалл | Низкая | 17 000 токенов в секунду на пользователя, без HBM |
У Google уже есть отдельная линия TPU для обучения и инференса. Такое разделение появилось в восьмом поколении TPU, которое компания анонсировала на Cloud Next в апреле. Frozen v2 должен жить рядом с этой линейкой, а не заменить её.
На 2028 год у Google есть ещё один крупный аппаратный план. Компания, по данным отраслевых сообщений, забронировала у Intel упаковку более чем 3 млн TPU. То есть Frozen v2 не отменяет массовые ускорители, а закрывает более узкую задачу.
Конкуренты уже пробуют жёстко привязать модели к железу
Идея чипа под конкретную модель уже вышла из лабораторных разговоров. Стартап Taalas из Торонто в феврале представил HC1 — кристалл площадью 815 мм² на техпроцессе TSMC N6.
В HC1 постоянно зашили Llama 3.1 8B. Компания заявляет 17 000 токенов в секунду на пользователя и обходится без HBM на корпусе. Это сильная ставка на инференс, но с очевидной ценой: сменить модель так же просто, как на GPU, уже не получится.
У Taalas есть больше $200 млн привлечённых инвестиций. Среди инвесторов называют Quiet Capital и Fidelity. Для маленького игрока это серьёзная заявка, но Google играет на другом поле: у неё есть собственные модели, облако, TPU и полный стек от софта до дата-центров.
Nvidia тоже не игнорирует эту сторону рынка. В декабре компания заключила сделку на $20 млрд с разработчиком инференс-чипов Groq для лицензирования технологий. Это показывает, что узкие ускорители для вывода моделей стали отдельной темой, а не экзотикой для стартапов.
Главный риск Frozen v2 — срок жизни. Если архитектура Gemini резко поменяется, узкий чип потеряет часть смысла. Если архитектура стабилизируется, Google получит шанс резко снизить стоимость и энергопотребление ответов в своих сервисах.
Google проект публично не подтвердила. Представитель компании сказал The Information, что не каждый проект доходит до производства, и добавил: «Такая строгая проработка лежит в основе нашего подхода full stack».