Сервер для запуска больших языковых моделей на Mac с чипами Apple Silicon, управляется из строки меню.
Позволяет держать часто используемые модели в памяти и автоматически подгружать более тяжёлые по требованию, гибко кэшируя контекст диалога в оперативной памяти и на SSD. Благодаря сохранению кэша между запросами локальные модели становится практично использовать для реальной работы, например с инструментами вроде Claude Code. Ставится как приложение для macOS с автообновлением или через Homebrew.
Описание автора:LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar
Python★ 21 771создан 13 февраля 2026форков 1 882Apache-2.0