Современные MoE модели (Mixture of Experts) становятся всё более популярными благодаря своей способности работать с меньшим количеством активных параметров. В отличие от Dense моделей, MoE используют лишь часть своих ресурсов для генерации токенов, что позволяет снижать требования к видеопамяти (VRAM) и использовать одну графическую карту в сочетании с обычной RAM.
Главная идея MoE заключается в том, что общее количество параметров превышает число активируемых для генерации токена. Специальный элемент — роутер — выбирает, к каким мини-подсетям (экспертам) направить запрос на каждом шаге. Это позволяет оптимизировать использование ресурсов модели.
Для ускорения работы MoE можно применять различные параметры, такие как —cmoe, которые помогают перераспределить загрузку между CPU и GPU. Например, в модели GPT-OSS-120B на каждом шагу активируются всего 4 из 128 экспертов, что значительно снижает потребление ресурсов.
Разные MoE модели обладают различной эффективностью, и некоторые из них могут запускаться даже на устройствах с ограниченной видеопамятью. Это открывает новые горизонты для локального использования больших языковых моделей, позволяя запускать их на даже на компьютерах с 8 Гб VRAM.