Alibaba представила новые мультимодальные модели Qwen3-VL-2B и Qwen3-VL-32B
Компания Alibaba представила две новые мультимодальные модели — Qwen3-VL-2B и Qwen3-VL-32B, последняя из которых уже привлекла внимание исследователей. Qwen3-VL-32B демонстрирует результаты, сопоставимые с такими моделями, как GPT-5 mini и Claude 4 Sonnet, особенно в областях STEM, визуальных вопросов (VQA), распознавании текста (OCR), анализе видео и агентных сценариях.
Несмотря на наличие «всего» 32 миллиардов параметров, Qwen3-VL-32B уверенно конкурирует с более крупными системами, достигающими 235 миллиардов параметров. На ряде бенчмарков, включая OSWorld, она показывает выдающиеся результаты благодаря новой архитектуре с «иерархическим вниманием», что позволяет эффективно интегрировать текст, изображения и видео.
Alibaba заявляет, что Qwen3-VL-32B способна последовательно анализировать видеокадры, понимая сюжет и причинно-следственные связи, что делает ее особенно ценной для видеоаналитики, автономных агентов и образовательных сценариев. Оба продукта уже доступны для тестирования на Hugging Face и платформе Qwen Studio с демо и API для интеграции в собственные решения.