Недавно Alibaba анонсировала свою новую коллекцию моделей Qwen3-VL. В блоге компании представлены ключевые возможности этих моделей. Они способны отвечать на вопросы на 32 языках, а также обрабатывать изображения. Пользователи могут отправлять картинки и запрашивать информацию о них, а также загружать нарисованные страницы и получать HTML-код интерфейса. Модели также умеют распознавать текст из сканированных страниц и объяснять математические формулы, химию и электронику. Контекстная длина составляет 256k токенов. Существуют две версии модели: с «рассуждениями» и без них. В последние недели автор использовал модель GPT-OSS-120B, но теперь перешел на Qwen3-VL-30B-A3B-Thinking-FP8. Несмотря на небольшую разницу в оценках производительности, Qwen3-VL-30B уникален возможностью обработки изображений. В новой версии vllm 0.11.0 добавлена поддержка этой модели. Для запуска необходима система с GPU и соответствующие настройки Docker. Скорость обработки достигает 4000 токенов в секунду. Модели предоставляют API, а пользователи могут отправлять запросы через утилиты или использовать интерфейсы, такие как OpenWebUI. В целом, Qwen3-VL предлагает мощные и удобные решения для работы с текстом и изображениями.
Вопрос-ответ
Какие ключевые возможности предлагает новая коллекция моделей Qwen3-VL?
Qwen3-VL способна отвечать на вопросы на 32 языках, обрабатывать изображения, принимать запросы по нарисованным страницам и возвращать HTML-код интерфейса. Модели умеют распознавать текст с сканов, объяснять математические формулы, химию и электронику. Контекстная длина достигает 256k токенов, есть версии с рассуждениями и без них.
Какой функционал связан с обработкой изображений и какие ограничения есть?
Модель может обрабатывать изображения, принимать изображения от пользователя, запрашивать информацию по ним, а также распознавать текст на сканированных страницах. В новой версии поддерживается обработка графических материалов, включая интерфейсы и страницы, возвращая соответствующий HTML-код. Возможности обработки изображений доступны в версии Qwen3-VL-30B-A3B-Thinking-FP8, и требуют соответствующей настройки окружения (GPU, Docker).
Какую инфраструктуру нужно подготовить для развёртывания Qwen3-VL?
Для запуска необходима система с GPU и корректная настройка Docker. В релизах упоминается поддержка в entorno с vllm 0.11.0, и для оптимальной производительности скорость обработки достигает примерно 4000 токенов в секунду.
Где можно получить доступ к API и как взаимодействовать с моделью?
Модели предоставляют API, и пользователи могут отправлять запросы через утилиты или через интерфейсы вроде OpenWebUI. Это обеспечивает гибкость интеграции и удобные способы взаимодействия с текстовым и визуальным контентом. В обзоре также отмечается наличие двух версий модели (с рассуждениями и без) и возможность загрузки интерфейсных элементов в виде HTML.