Альтернатива RAG для языковых моделей: нужные данные заранее загружаются прямо в контекст модели вместо поиска по документам.
Cache-Augmented Generation (CAG) предлагает не искать документы в реальном времени, как это делает RAG, а заранее загрузить всю нужную информацию в окно контекста модели и закешировать её внутреннее состояние. Это ускоряет ответы и снижает количество ошибок, вызванных неудачным поиском по базе. Ограничение метода — вся база знаний должна помещаться в контекст модели, поэтому для очень больших массивов данных он не подходит.
Описание автора:Cache-Augmented Generation: A Simple, Efficient Alternative to RAG