Заголовки

Alibaba Cloud представляет Qwen3.5-Omni: новое поколение мультимодальной модели

Команда Qwen от Alibaba Cloud презентовала свою новейшую разработку — Qwen3.5-Omni, мультимодальную модель, способную обрабатывать текст, изображения, аудио и видео, а также генерировать текст и речь в реальном времени. Модель доступна в трех вариантах: Plus, Flash и Light, и может использоваться через Offline API и Realtime API.

Основное отличие от предыдущей версии, Qwen3-Omni, заключается в увеличении масштабов: контекстное окно расширилось с 32 до 256 тысяч токенов, что позволяет обрабатывать до 10 часов аудио или 400 секунд видео 720p за один запрос. Теперь распознавание охватывает 113 языков и диалектов (вместо 19), а синтез — 36 языков (вместо 10).

Версия Plus продемонстрировала выдающиеся результаты в большинстве аудиовизуальных тестов, обойдя конкурентов в распознавании и переводе речи. Новые функции включают семантическое прерывание, клонирование голоса и динамическое выравнивание текстовых и речевых токенов. Интересной особенностью является Audio-Visual Vibe Coding, позволяющая модели писать код, основываясь на видео с аудиоинструкциями без текстовых подсказок, что стало неожиданным, но полезным эффектом масштабирования.