Заголовки

Новый формат чисел NVFP4 от NVIDIA для обучения языковых моделей

NVIDIA представила новый формат чисел NVFP4, предназначенный для обучения больших языковых моделей, который использует всего четыре бита на число, вместо традиционных восьми или шестнадцати. Это новшество позволяет почти полностью сохранить точность вычислений, ускоряя процесс обучения в 2-3 раза и снижая потребление памяти на 50%.

В рамках эксперимента NVIDIA обучила 12-миллиардную модель Mamba Transformer на десяти триллионах токенов. Результаты показали, что модель с 4-битным NVFP4 демонстрирует почти такие же показатели, как и FP8, как в тестах MMLU Pro, так и в задачах программирования MBPP+.

Структура NVFP4 организует данные в блоки по 16 чисел, для которых хранится небольшой масштаб в 8 бит, а глобальный масштаб составляет 32 бита. Это обеспечивает стабильность обучения и точность значений. Метод включает стохастическое округление для минимизации ошибок, а переход на BF16 на последних этапах обучения полностью устраняет оставшиеся различия.

Формат NVFP4 уже интегрирован в Transformer Engine и новое поколение GPU Blackwell, где операции с FP4 выполняются в 2-3 раза быстрее, чем с FP8, а потери точности при валидации составляют всего 1-1.5%. NVFP4 открывает новые возможности для исследователей и разработчиков в области ИИ, улучшая эффективность вычислительных ресурсов.

Вопрос-ответ

Каким образом формат NVFP4 достигает ускорения обучения при сохранении точности?

NVFP4 использует всего четыре бита на число и структурирует данные в блоки по 16 чисел с локальным масштабом на 8 бит и глобальным масштабом на 32 бита. Этот подход позволяет резко снизить объем памяти и увеличить пропускную способность вычислений. Стохастическое округление и последующая коррекция на этапах BF16 снижают остаточные ошибки, обеспечивая близкую к FP8 точность на ключевых метриках и задачах.

Как устроена организация данных и какие размеры масштабов применяются?

Данные в NVFP4 организованы в блоки по 16 чисел. В каждом блоке хранится локальный масштаб в 8 бит, что daёт компактное представление, а глобальный масштаб занимает 32 бита, обеспечивая стабильность и точность вычислений в рамках большой матрицы операций. Это сочетание локального и глобального масштабов позволяет сохранять точность при значительном снижении объема памяти.

Какие результаты экспериментов NVIDIA привела на модели Mamba Transformer?

В экспериментах NVIDIA обучила 12-миллиардную модель на десяти триллионах токенов и показала, что 4-битный NVFP4 обеспечивает почти те же показатели, что FP8, на тестах MMLU Pro и в задачах программирования MBPP+. Это свидетельствует о высокой пригодности NVFP4 для обучения крупных языковых моделей с сохранением точности.

Где интегрирован NVFP4 и какие преимущества это приносит?

NVFP4 интегрирован в Transformer Engine и новое поколение GPU Blackwell, где операции FP4 выполняются в 2-3 раза быстрее, чем FP8, с потерями точности на валидации всего в 1-1.5%. Эти преимущества позволяют исследователям и разработчикам эффективнее использовать вычислительные ресурсы при обучении огромных моделей.