Содержание
Google Cloud на конференции Google Cloud Next 2026 представила TPU восьмого поколения и сразу разделила линейку на две ветки: TPU 8t для обучения и TPU 8i для посттренинга и инференса. Главный акцент в этот раз — не только на вычисления, но и на память: компания прямо говорит, что для «агентной» эпохи ИИ упираемся в задержки и пропускную способность.
Новые TPU проектировали под длинные контекстные окна, многошаговые цепочки рассуждений и «всегда включённые» сценарии. Google Cloud описывает это как перестройку инфраструктуры под persistent memory, continuous inference и мультимодельные нагрузки.
TPU 8t: ставка на обучение в гигантских кластерах
TPU 8t Google Cloud оптимизировала под распределённое обучение foundation-моделей в больших кластерах. По словам компании, чип даёт около 80% год-к-году прироста производительности на доллар, чтобы эффективнее тренировать модели с триллионами параметров.
Ключевая витрина — суперпод. Один TPU 8t superpod масштабируется до 9 600 чипов, даёт 2 ПБ общей HBM и до 121 ExaFLOPS вычислений.
Для сравнения, прошлогодний Ironwood в конфигурации superpod оценивали в 9 216 чипов и 42,5 ExaFLOPS. То есть прирост по «потолку» вычислений в суперподах выглядит почти трёхкратным, при сопоставимом масштабе по числу ускорителей.
TPU 8i: больше SRAM, больше HBM и крупнее pod
TPU 8i Google Cloud позиционирует как двигатель для посттренинга и инференса. Компания отдельно предупреждает о «стене задержек» (latency wall) в мире, где агентные системы работают постоянно и отвечают в реальном времени.
По спецификациям 8i получил примерно 3x больше on-chip SRAM — до 384 МБ. Память HBM выросла до 288 ГБ.
Ещё один сдвиг — масштабирование pod: теперь до 1 152 чипов вместо 256. Производительность pod заявлена на уровне 11,6 ExaFLOPS, тогда как раньше было 1,2 ExaFLOPS.
Энергоэффективность и планы на миллион чипов
Google Cloud заявляет до 2x лучшую производительность на ватт по сравнению с Ironwood. SVP и Chief Technologist for AI and Infrastructure Amin Vahdat на мероприятии сказал: «We’ve innovated across hardware and software to enable our data centers to deliver six times more computing power per unit of electricity than they did just five years ago» (по смыслу: компания улучшала и железо, и софт, чтобы за пять лет получить 6-кратный рост вычислений на единицу электричества).
По срокам Google Cloud говорит о старте общей доступности для клиентов в ближайшие месяцы. TPU 8t и 8i компания ставит в основу актуальных моделей Gemini.
Ещё один ориентир — масштабирование обучения «за пределы одного суперпода» через Pathways и JAX. На Cloud Next 2026 топ-менеджеры подтвердили, что кластер более чем на 1 млн TPU-чипов для одной тренировки пока остаётся теоретическим сценарием, хотя технически его считают возможным.