Llama-3.1-Nemotron-Ultra-253B-v1 — это крупная языковая модель (LLM), оптимизированная для выполнения задач, требующих продвинутого рассуждения, интерактивного общения с людьми, генерации с расширенным извлечением (RAG) и вызова инструментов. Основанная на Meta’s Llama-3.1-405B-Instruct, она была значительно модифицирована с использованием Neural Architecture Search (NAS), что позволило повысить эффективность, снизить потребление памяти и улучшить задержку вывода. Модель поддерживает длину контекста до 128K токенов и может эффективно работать на узле с 8 графическими процессорами NVIDIA H100.
Примечание: для активации рассуждения необходимо включить detailed thinking on в системной подсказке. Пожалуйста, ознакомьтесь с Рекомендациями по использованию для получения более подробной информации.