Tongyi DeepResearch — это агентная масштабная языковая модель, разработанная лабораторией Tongyi Lab. Она содержит 30 млрд параметров, при этом для каждого токена активируется лишь около 3 млрд. Модель оптимизирована для долгосрочных, глубоких задач поиска информации и демонстрирует передовые результаты на бенчмарках Humanity’s Last Exam, BrowserComp, BrowserComp-ZH, WebWalkerQA, GAIA, xbench-DeepSearch и FRAMES. Благодаря этому она превосходит предыдущие модели в сложных агентных поисковых сценариях, логических выводах и многоэтапном решении задач.
В состав модели входит полностью автоматизированный конвейер синтетических данных для масштабируемого предобучения, дообучения и обучения с подкреплением. Для усиления рассуждений и поддержания актуальности используется масштабное непрерывное предобучение на разнообразных агентных данных. Кроме того, реализовано сквозное on-policy обучение с подкреплением с кастомизированной оптимизацией групповой относительной политики (Group Relative Policy Optimization), включающей градиенты на уровне токенов и фильтрацию негативных примеров для стабильного обучения. Модель поддерживает фреймворк ReAct для проверки базовых возможностей и предлагает «Heavy» режим на базе IterResearch для максимальной производительности за счёт масштабирования во время выполнения. Идеально подходит для продвинутых исследовательских агентов, работы с внешними инструментами и ресурсоёмких рабочих процессов вывода.