Заголовки

Новая система CUDA L2 от DeepReinforce значительно ускоряет матричное умножение

Исследователи из команды DeepReinforce представили инновационную систему CUDA L2, способную автоматически генерировать высокопроизводительный GPU код для матричного умножения. Созданные ею ядра HGEMM показывают среднее ускорение на 10-30% по сравнению с такими эталонами, как cuBLAS и cuBLASLt, разработанными специалистами NVIDIA. CUDA L2 меняет традиционные подходы к оптимизации, применяя сочетание языковой модели и обучения с подкреплением. Система формирует CUDA ядро с нуля под конкретные размеры матриц, а затем тестирует его на реальном оборудовании. Данная методология позволяет генерировать код, который не ограничен человеческими шаблонами, что улучшает его эффективность. Тесты показывают, что в оффлайн режиме CUDA L2 достигает скорости на 17-22% выше, чем torch.matmul и cuBLAS. В серверных сценариях ускорение возрастает до 24-29%. Авторы планируют расширение системы на новые архитектуры и более плотные конфигурации.