Перейти к содержанию

·Naasson Geo

Какие нагрузки живут на узком канале

Обучение больших моделей через глобальную сеть — уже работающий класс архитектур. 12B-модель обучили через четыре ЦОД на 0,84 Гбит/с между узлами.

Возражение против ЦОД в горах звучит одинаково: без быстрого канала там нечего вычислять. Возражение было верным до появления класса архитектур, специально спроектированных под медленную связь между узлами.

Что не работает и почему

Обучение frontier-модели в одном кампусе требует связности порядка четырёхсот гигабит в секунду между десятками тысяч ускорителей. Тензорный параллелизм обменивается активациями на каждом проходе вперёд и назад — это допустимо только внутри узла, на межчиповой шине. Конвейерный параллелизм терпит уже десятки гигабит, но остаётся задачей внутри кампуса.

Моделям со смесью экспертов дополнительно нужен обмен «все со всеми» между экспертами, и по публикуемым замерам он способен занимать почти половину времени исполнения. Такие модели между дата-центрами не разносятся вообще.

Мы этого класса задач не заявляем. Обучение самых больших моделей целиком — задача внутри кампуса, и площадка в горах на неё не претендует.

Что работает

Отдельный класс алгоритмов синхронизируется не на каждом шаге, а раз в несколько сотен шагов. Обмен идёт не градиентами, а накопленным сдвигом веса, и объём трафика падает на два порядка.

0,84 Гбит/с
между восемью ЦОД в опубликованном эксперименте
12B
параметров у обученной так модели
1–10 Гбит/с
даёт спутниковый этап нашей площадки

Опубликованные результаты этого направления: обучение с восемью работниками не хуже полностью синхронного варианта при обмене в пятьсот раз меньшем; последующие варианты добавили синхронизацию подмножеств параметров по очереди, продолжение обучения во время обмена и квантование передаваемых данных — суммарно снижение требований к каналу ещё на два порядка.

В одном из последних опубликованных экспериментов модель на двенадцать миллиардов параметров обучили через четыре дата-центра, а требования к полосе снизили до 0,84 гигабита в секунду между восемью площадками — при сохранении высокой доли полезной работы даже на заметных частотах отказов.

Наш первый этап связи — спутник, от одного до десяти гигабит в секунду. Он этим требованиям удовлетворяет. Второй этап — волокно — превышает их с большим запасом.

Где основной объём рынка

Существенная часть коммерческого спроса на вычисления в GPU-часах — это не обучение самых больших моделей. Это дообучение, обучение с подкреплением, пакетный вывод, генерация синтетических данных, научные расчёты и рендеринг.

Дообучение крупной модели методом низкоранговой адаптации — это часы работы на одном ускорителе и веса в несколько десятков гигабайт при квантовании. Завезти такой объём через спутник — вопрос времени, а не возможности.

Что остаётся за пределами первого этапа

Вывод с гарантией отклика ниже пятидесяти миллисекунд. Здесь физика на стороне возражения: задержка спутникового канала не лечится алгоритмами.

Этот класс нагрузок мы относим ко второму этапу связи и не обещаем раньше. Разница между «сейчас нельзя» и «нельзя никогда» существенна, но и разница между «можно после волокна» и «можно сегодня» тоже.

Почему это техническое обоснование, а не аргумент

Мы приводим ссылки на публикации и конкретные измеренные величины, а не общие рассуждения о распределённом обучении. Заказчик, который собирается размещать нагрузку, должен иметь возможность проверить утверждение — и, что важнее, проверить, относится ли оно к его собственной нагрузке.

Ответ «зависит от вашего профиля обмена» звучит уклончиво. Он же единственно верный: пригодность площадки определяется не её каналом, а тем, сколько по этому каналу нужно вашей задаче.