Meta сократила загрузку AI-датасетов с часов до минут после перестройки хранилищ. Компания признала, что дорогие GPU слишком часто простаивали из-за медленной подачи данных.

Для владельца Facebook, Instagram, Reality Labs и Meta AI это не тонкая оптимизация ради красивого графика. В больших AI-кластерах простой GPU быстро превращается в деньги, которые буквально сгорают в стойке. Если ускоритель ждёт данные, он не обучает модель и не приносит результата.

GPU упёрлись не в вычисления, а в хранилище

Инженеры Meta описали проблему так: вычислительная мощность AI-серверов росла быстрее, чем системы хранения. Из-за этого пайплайны обучения регулярно тормозили на доступе к данным, а не на матричных операциях внутри GPU.

Продолжение после рекламы

Meta управляет сотнями кластеров хранения эксабайтного масштаба. Они обслуживают Facebook, Instagram, Reality Labs, рекламные системы, базы данных, внутренние дата-склады и Meta AI.

В основе этой инфраструктуры лежит слой Tectonic. Он работает с объектным хранением, файловыми системами, блочными устройствами и размещением данных между HDD и SSD.

С ростом AI-нагрузок Meta активнее переходит от классического файлового хранения к BLOB-хранилищам. Причина простая: огромным датасетам нужен единый способ доступа и более высокая скорость выдачи.

Meta убрала лишние слои между GPU и данными

Главная задержка возникала на метаданных. Когда GPU-сервер запрашивал данные, система проходила несколько уровней проверок и поисков. Каждый такой шаг добавлял миллисекунды, а на масштабе обучения это превращалось в часы простоя.

Изображение к статье: Meta ускорила загрузку AI-датасетов с часов до минут

Meta перестроила подсистему метаданных в единую схему на базе ZippyDB. Клиенты теперь могут забирать данные напрямую с серверов хранения, без постоянной прокладки через прикладные серверы.

Новый встроенный клиент стримит данные прямо из слоя Tectonic. Для распределённых AI-кластеров компания разместила региональные BLOB-хранилища рядом с GPU-фермами. Так данные меньше путешествуют между удалёнными дата-центрами.

  • L1: кэш в памяти GPU или хост-системы рядом с ускорителями
  • L2: SSD внутри GPU-хостов для часто нужных данных
  • L3: региональное BLOB-хранилище на flash-накопителях
  • Источник истины: более дешёвые HDD для постоянного хранения массивов

Meta использовала свободную память GPU-хостов как распределённый кэш. Средний cache hit rate достиг 80%, а доступ к метаданным занял 1-2 мс.

SSD-кэш снял часы ожидания перед обучением

Самый наглядный результат проявился ещё до старта обучения. Раньше исследователи переносили огромные снимки датасетов из BLOB-хранилищ в региональные GPU-зоны, и этот этап мог длиться часами.

После внедрения многоуровневого кэша один процесс загрузки сократился со 150 минут до 10 минут. Другая задача раньше занимала 89 часов, а теперь завершается чуть больше чем за три часа.

Продолжение после рекламы

Экономика здесь напоминает сборку домашнего ПК, только в планетарном масштабе. Можно купить дешёвый жёсткий диск и радоваться цене за терабайт. Но если видеокарта за сотни тысяч рублей ждёт текстуры с медленного накопителя, экономия быстро теряет смысл.

Аналитик Jukan из Citrini формулирует это через стоимость простоя. Если час ожидания GPU стоит дороже, чем flash-кэш на тот же период, покупка SSD выглядит рационально. Для AI-кластеров Meta этот расчёт оказался важнее классической метрики «цена за терабайт».

Технические детали перестройки хранилища также разобрали Blocks and Files. Инженеры Meta описали итог новой архитектуры коротко: «новый стек BLOB-хранилища теперь способен обслуживать AI-нагрузки без остановок GPU».

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.