QwQ-32B-ArliAI-RpR-v1 — модель с 32 миллиардами параметров, дообученная на базе Qwen/QwQ-32B с использованием специально отобранного датасета для креативного письма и ролевых игр, изначально разработанного для серии RPMax. Она создана для сохранения целостности и качества рассуждений в долгих многоходовых диалогах, вводя явные шаги логического вывода на каждом ходе беседы, которые генерируются и уточняются самой базовой моделью.
Модель обучалась с помощью RS-QLORA+ на последовательностях длиной 8K токенов и поддерживает контекстные окна объёмом до 128K токенов (на практике эффективно обрабатывает около 32K токенов). Она оптимизирована для творческого ролевого взаимодействия и генерации диалогов с акцентом на минимизацию повторов между различными частями контекста при сохранении стилистического разнообразия.