DeepReinforce представила революционную систему CUDA L2 для оптимизации GPU кода

Команда DeepReinforce анонсировала CUDA L2 — систему, создающую GPU код для матричного умножения с эффективностью, которая превышает cuBLAS и cuBLASLt на 10–30%. Это достижение, учитывая, что данные библиотеки были вручную оптимизированы специалистами NVIDIA, вызвало большой интерес в технологической среде.

CUDA L2 принципиально меняет подход к оптимизации: вместо фиксированных шаблонов, система использует сочетание языковой модели и обучения с подкреплением. LLM генерирует CUDA ядро для конкретного размера матрицы, а RL проверяет его производительность на реальном оборудовании, корректируя код до оптимального варианта.

Система DeepSeek 671B, прошедшая дополнительное обучение на высококачественном коде, обрабатывает около тысячи конфигураций матриц, что обеспечивает широкий спектр применения. Тесты показали, что в оффлайн режиме CUDA L2 быстрее torch.matmul и cuBLAS на 17–22%, а в серверном сценарии это ускорение достигает 24–29%.

Авторы планируют расширение метода на новые архитектуры и более плотные конфигурации. CUDA L2 может установить новые стандарты в области оптимизации, где языковые модели становятся ключевыми инженерами производительности.

Вам также может понравиться...