NVIDIA Nemotron Nano 2 VL — это открытая мультимодальная модель с 12 млрд параметров, разработанная для анализа видео и интеллектуальной обработки документов. Она основана на гибридной архитектуре Transformer–Mamba, которая сочетает точность трансформеров с памятьэффективным последовательностным моделированием Mamba, что обеспечивает существенно более высокую пропускную способность и меньшую задержку.
Модель принимает на вход текст и документы с несколькими изображениями, а на выходе генерирует ответы на естественном языке. Обучение проводилось на высококачественных синтетических наборах данных, отобранных и подготовленных NVIDIA, оптимизированных для оптического распознавания символов (OCR), анализа графиков и мультимодального понимания.
Nemotron Nano 2 VL демонстрирует лучшие результаты в бенчмарке OCRBench v2 и набирает в среднем около 74 баллов по задачам MMMU, MathVista, AI2D, OCRBench, OCR-Reasoning, ChartQA, DocVQA и Video-MME, превосходя предыдущие открытые мультимодальные модели. Благодаря технологии Efficient Video Sampling (EVS) модель эффективно обрабатывает длинные видеоролики, снижая вычислительные затраты на инференс.
Все веса модели, данные для обучения и рецепты дообучения выпущены под свободной лицензией NVIDIA. Развёртывание поддерживается в фреймворках NeMo и NIM, а также в основных средах для инференса.