Новая система Monarch от PyTorch для распределённых вычислений
Команда PyTorch анонсировала новую систему распределённых вычислений под названием Monarch, которая позволяет управлять тысячами графических процессоров с помощью одного Python-скрипта. Ранее разработчики использовали SPMD-подход, при котором каждый узел выполнял одинаковый код автономно. С Monarch этот принцип изменён: теперь можно создать одну управляющую программу, а фреймворк сам распределяет задачи и синхронизацию между узлами.
Монарх вводит концепцию многомерных вычислительных сеток (meshes), что позволяет процессам и актерам взаимодействовать напрямую, передавая данные GPU без участия CPU через RDMA. Это значительно уменьшает накладные расходы и ускоряет такие задачи, как обучение RL, тонкая настройка и многомодальный анализ.
Система полностью совместима с Python, что позволяет использовать Jupyter Notebook и отлаживать код в реальном времени. Monarch поддерживает динамическое масштабирование, отказоустойчивость и удобную отладку.
Фреймворк уже интегрирован в TorchForge, VERL и Lightning AI, что делает его возможным стандартом для нового поколения распределённого обучения. Monarch преобразует кластер в единый мозг, управляемый из одного интерфейса. Следите за новостями!