Google и NVIDIA расширили сотрудничество в облаке: в Google Cloud появились новые виртуальные машины A5X, рассчитанные на работу с NVIDIA Vera Rubin. По заявленным параметрам инфраструктура масштабируется до 80 000 GPU в одном кластере и до 960 000 GPU в мультисайтовом кластере.

Google подаёт A5X как инстансы под агентные (agentic) AI-нагрузки. Это сценарии, где задачу решает группа моделей или «агентов», разбивая её на шаги.

A5X — первые инстансы Google Cloud под NVIDIA Vera Rubin

A5X вошли в портфель Google AI Hypercomputer — эту же платформу Google использует для Gemini и корпоративных AI-сервисов. Вместе с A5X компания анонсировала и другие обновления Hypercomputer: виртуальные машины на кастомных Arm-процессорах, TPU восьмого поколения и нативную поддержку PyTorch для TPU.

Продолжение после рекламы

Ключевой момент именно в A5X: это первые инстансы Google, которые спроектировали под работу с последним поколением AI-ускорителей NVIDIA — Vera Rubin. Google явно делает ставку на «агентность» как на следующий тип продакшн-нагрузок, где важны не только большие модели, но и скорость, цена и масштабирование.

ConnectX-9 и Virgo: как растягивают кластеры почти до миллиона GPU

Изображение к статье: Google Cloud запустила A5X с NVIDIA Vera Rubin: до 960 000 GPU

Сетевую часть A5X строят на NVIDIA ConnectX-9 — это NIC для ускорения AI-нагрузок в Ethernet-инфраструктуре. Дальше в игру вступает платформа Google Virgo, которая связывает чипы внутри дата-центра и между площадками.

Архитектура Макс. кластер в одном дата-центре Макс. мультисайтовый кластер
NVIDIA Vera Rubin GPUs 80 000 960 000
Google Custom TPUs 134 000 1 000 000+
Сетевой «хребет» NVIDIA ConnectX-9 Google Virgo

То есть для GPU Google называет потолок 80 тысяч в рамках одного кластера на площадке. А для мультисайта — уже 960 тысяч. Для собственных TPU цифры ещё выше: 134 тысячи в одном дата-центре и более миллиона чипов между площадками.

10x по экономике инференса: что обещает NVIDIA

NVIDIA заявляет, что A5X дают 10x более низкую стоимость инференса на токен и 10x более высокий throughput на мегаватт по сравнению с предыдущим поколением. Речь именно про инференс, то есть «прогон» модели в продакшене, где цена токена и эффективность на ватт часто решают больше, чем пиковые цифры обучения.

Отдельно NVIDIA упоминает, что её инфраструктуру в Google Cloud используют для задач физического и индустриального AI — в том числе решения компаний Cadence и Siemens. А Gemini, по словам Google, может разворачивать агентные модели и workflow в разных индустриях, включая кибербезопасность.

Цены на A5X и сроки доступности по регионам в этом анонсе не раскрыли.

Рейтинг: 0 / 5. Оценок: 0

Продолжение после рекламы

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.