MAI-DS-R1 — дообученный вариант DeepSeek-R1, разработанный командой Microsoft AI для улучшения реакции модели на ранее заблокированные темы и повышения её уровня безопасности. Построенная на базе рассуждающих способностей DeepSeek-R1, она включает 110 000 примеров из набора данных Tulu-3 SFT и 350 000 внутрикорпоративных многоязычных примеров для выравнивания по критериям безопасности. Модель сохраняет мощные возможности в рассуждении, программировании и решении задач, при этом разблокируя широкий спектр запросов, ранее ограниченных в R1.
MAI-DS-R1 демонстрирует улучшенные показатели по бенчмаркам снижения вреда и остаётся конкурентоспособной в общих задачах рассуждения. Она превосходит R1-1776 по метрикам удовлетворённости пользователей при работе с заблокированными запросами и сокращает утечку вредоносного контента. Модель построена на архитектуре трансформера Mixture of Experts (MoE) и подходит для широкого круга задач общего назначения, за исключением критически важных областей, таких как право, медицина или автономные системы.