MiniMax-M3 — это мультимодальная базовая модель от MiniMax с окном контекста в 1 млн токенов. Она принимает на входе текст, изображения и видео, выдаёт текстовый результат и хорошо подходит для агентных задач с долгим горизонтом выполнения, программирования и использования инструментов. В основе модели — архитектура MiniMax Sparse Attention (MSA): она заменяет полное внимание выбором KV-блоков, снижая затраты на токен при длинном контексте примерно в 20 раз по сравнению с предыдущим поколением при контексте в 1 млн токенов, при этом заметно ускоряет обработку контекста и генерацию токенов, сохраняя качество на большинстве задач.
Модель обучена как нативная мультимодальная система на чередующихся данных и настроена для многоходового взаимодействия, приближенного к реальному использованию, с помощью интерактивного фреймворка с симуляцией пользователя. Она ориентирована на устойчивые многошаговые задачи, а не на выполнение в один ход.