Kimi Linear — гибридная архитектура линейного внимания, которая превосходит традиционные методы полного внимания в различных сценариях, включая работу с короткими и длинными контекстами, а также масштабирование в задачах обучения с подкреплением (RL). В её основе лежит Kimi Delta Attention (KDA) — доработанная версия Gated DeltaNet с более эффективным механизмом гейтинга для оптимизации использования памяти RNN с конечным числом состояний.
Kimi Linear обеспечивает выдающуюся производительность и аппаратную эффективность, особенно в задачах с длинным контекстом. Он сокращает объём кэшей ключей и значений (KV cache) до 75% и увеличивает пропускную способность декодирования до шести раз при работе с контекстами длиной до 1 млн токенов.