Содержание
Google и NVIDIA расширили сотрудничество в облаке: в Google Cloud появились новые виртуальные машины A5X, рассчитанные на работу с NVIDIA Vera Rubin. По заявленным параметрам инфраструктура масштабируется до 80 000 GPU в одном кластере и до 960 000 GPU в мультисайтовом кластере.
Google подаёт A5X как инстансы под агентные (agentic) AI-нагрузки. Это сценарии, где задачу решает группа моделей или «агентов», разбивая её на шаги.
A5X — первые инстансы Google Cloud под NVIDIA Vera Rubin
A5X вошли в портфель Google AI Hypercomputer — эту же платформу Google использует для Gemini и корпоративных AI-сервисов. Вместе с A5X компания анонсировала и другие обновления Hypercomputer: виртуальные машины на кастомных Arm-процессорах, TPU восьмого поколения и нативную поддержку PyTorch для TPU.
Ключевой момент именно в A5X: это первые инстансы Google, которые спроектировали под работу с последним поколением AI-ускорителей NVIDIA — Vera Rubin. Google явно делает ставку на «агентность» как на следующий тип продакшн-нагрузок, где важны не только большие модели, но и скорость, цена и масштабирование.
ConnectX-9 и Virgo: как растягивают кластеры почти до миллиона GPU
Сетевую часть A5X строят на NVIDIA ConnectX-9 — это NIC для ускорения AI-нагрузок в Ethernet-инфраструктуре. Дальше в игру вступает платформа Google Virgo, которая связывает чипы внутри дата-центра и между площадками.
| Архитектура | Макс. кластер в одном дата-центре | Макс. мультисайтовый кластер |
|---|---|---|
| NVIDIA Vera Rubin GPUs | 80 000 | 960 000 |
| Google Custom TPUs | 134 000 | 1 000 000+ |
| Сетевой «хребет» | NVIDIA ConnectX-9 | Google Virgo |
То есть для GPU Google называет потолок 80 тысяч в рамках одного кластера на площадке. А для мультисайта — уже 960 тысяч. Для собственных TPU цифры ещё выше: 134 тысячи в одном дата-центре и более миллиона чипов между площадками.
10x по экономике инференса: что обещает NVIDIA
NVIDIA заявляет, что A5X дают 10x более низкую стоимость инференса на токен и 10x более высокий throughput на мегаватт по сравнению с предыдущим поколением. Речь именно про инференс, то есть «прогон» модели в продакшене, где цена токена и эффективность на ватт часто решают больше, чем пиковые цифры обучения.
Отдельно NVIDIA упоминает, что её инфраструктуру в Google Cloud используют для задач физического и индустриального AI — в том числе решения компаний Cadence и Siemens. А Gemini, по словам Google, может разворачивать агентные модели и workflow в разных индустриях, включая кибербезопасность.
Цены на A5X и сроки доступности по регионам в этом анонсе не раскрыли.