Qwen2.5 VL 7B — мультимодальная большая языковая модель (LLM) от команды Qwen, обладающая следующими ключевыми улучшениями:
-
Передовое понимание изображений в любых разрешениях и соотношениях сторон
Qwen2.5-VL демонстрирует лучшие в отрасли результаты на бенчмарках визуального понимания, включая MathVista, DocVQA, RealWorldQA, MTVQA и другие.
-
Понимание видео продолжительностью более 20 минут
Qwen2.5-VL способен анализировать видео длительностью свыше 20 минут для высококачественного ответа на вопросы по видеоконтенту, ведения диалогов, генерации материалов и прочего.
-
Агент для управления мобильными устройствами, роботами и другими девайсами
Обладая возможностями сложного рассуждения и принятия решений, Qwen2.5-VL может быть интегрирован со смартфонами, роботами и т. д., обеспечивая автоматическое управление на основе визуальной среды и текстовых инструкций.
-
Мультиязычная поддержка
В дополнение к английскому и китайскому Qwen2.5-VL понимает тексты на различных языках внутри изображений, включая большинство европейских языков, японский, корейский, арабский, вьетнамский и другие.
Подробнее см. в блог-посте: https://qwenlm.github.io/blog/qwen2-vl/
Исходный код и инструкции — в репозитории GitHub: https://github.com/QwenLM/Qwen2-VL
Использование модели регулируется лицензионным соглашением Tongyi Qianwen (https://huggingface.co/Qwen/Qwen1.5-110B-Chat/blob/main/LICENSE).