Программа для запуска больших языковых моделей (LLM) на обычном компьютере или сервере без облачных сервисов, даже на слабом железе.
llama.cpp написан на C++ и позволяет запускать LLM и модели с изображениями локально — на процессорах и видеокартах разных производителей (Apple, NVIDIA, AMD), без обязательных внешних зависимостей. Поддерживает сжатие моделей (квантование) для экономии памяти и включает готовый веб-интерфейс и серверный API. Используется теми, кто хочет запускать ИИ-модели у себя, не отправляя данные в облако.