Spotlight — это визуально-языковая модель с семью миллиардами параметров, основанная на Qwen 2.5-VL и донастроенная Arcee AI для задач точного связывания изображений и текста. Она поддерживает окно контекста до 32 000 токенов, что позволяет вести насыщенные мультимодальные диалоги с объёмными документами и одним или несколькими изображениями. При обучении акцент был сделан на быстром выводе на потребительских видеокартах при сохранении высокой точности в генерации подписей, визуальных вопросах-ответах и анализе диаграмм. В итоге Spotlight легко интегрируется в рабочие процессы агентов, где требуется моментальная интерпретация скриншотов, графиков или макетов интерфейса. По результатам первых бенчмарков она сравнима или превосходит более крупные визуально-языковые модели, такие как LLaVA-1.6 13 B, в популярных тестах VQA и POPE на выравнивание.