Llama Guard 3 — предварительно обученная модель Llama-3.1-8B, дообученная для классификации безопасности контента. Как и предыдущие версии, она позволяет анализировать как входные данные LLM (классификация запросов), так и её ответы (классификация ответов). Модель функционирует как LLM: в своём выводе она указывает, является ли заданный запрос или ответ «безопасным» или «небезопасным», а при обнаружении небезопасного контента перечисляет нарушенные категории.
Llama Guard 3 приведена в соответствие со стандартизованной таксономией угроз MLCommons и разработана с учётом возможностей Llama 3.1. В частности, она обеспечивает модерацию контента на восьми языках и оптимизирована для повышения безопасности при поисковых запросах и вызове инструмента интерпретатора кода.