Исследователи из команды DeepReinforce представили инновационную систему CUDA L2, способную автоматически генерировать высокопроизводительный GPU код для матричного умножения. Созданные ею ядра HGEMM показывают среднее ускорение на 10-30% по сравнению с такими эталонами, как cuBLAS и cuBLASLt, разработанными специалистами NVIDIA. CUDA L2 меняет традиционные подходы к оптимизации, применяя сочетание языковой модели и обучения с подкреплением. Система формирует CUDA ядро с нуля под конкретные размеры матриц, а затем тестирует его на реальном оборудовании. Данная методология позволяет генерировать код, который не ограничен человеческими шаблонами, что улучшает его эффективность. Тесты показывают, что в оффлайн режиме CUDA L2 достигает скорости на 17-22% выше, чем torch.matmul и cuBLAS. В серверных сценариях ускорение возрастает до 24-29%. Авторы планируют расширение системы на новые архитектуры и более плотные конфигурации.