Эта модель защиты (safeguard) содержит 8 млрд параметров и основана на семействе Llama 3. Как и её предшественница LlamaGuard 1, она выполняет классификацию как запросов, так и ответов.
LlamaGuard 2 функционирует как обычная большая языковая модель (LLM): генерирует текст, который указывает, безопасен ли данный ввод/вывод. Если данные признаны небезопасными, модель также сообщает о нарушенных категориях контента.
Для достижения оптимальных результатов рекомендуется использовать необработанный ввод подсказки (raw prompt) или endpoint /completions вместо чат-API.
В оценках, проведённых людьми, модель показала высокую эффективность по сравнению с ведущими проприетарными решениями.
Подробнее о выпуске модели читайте по ссылке: https://ai.meta.com/blog/meta-llama-3/. Использование модели регулируется Политикой приемлемого использования Meta: https://llama.meta.com/llama3/use-policy/