Пошаговый учебный репозиторий о том, как устроен инференс больших языковых моделей изнутри — от токенизации до батчинга запросов.
Материалы объясняют, что происходит при обработке запроса к LLM: токенизация, prefill и decode, рост KV-кэша, планирование запросов, непрерывный батчинг и управление памятью GPU — с прямым просмотром тензоров и состояния кэша в коде. Курс не про обучение моделей или качество ответов, а про скорость, память и пропускную способность систем вывода. Разбит на уровни Beginner, Intermediate и Advanced.
Jupyter Notebook★ 77создан 14 сентября 2026форков 3