Практический курс, где читатели строят собственный мини-движок вывода LLM с нуля, а затем разбирают исходники SGLang.
Курс от Datawhale и RadixArk объясняет, как работает инференс больших языковых моделей: зачем нужен KV Cache, чем prefill отличается от decode, что значит compute-bound и memory-bound. Пошагово читатель собирает собственный мини-движок вывода — прямой проход, генерацию, кэш, HTTP-сервер, батчинг, — а затем переходит к чтению кода настоящего SGLang и подготовке своего первого пул-реквеста. Доступен на английском и китайском языках.
Описание автора:Official SGLang x Datawhale course on LLM inference: understand inference, build a mini-sglang from scratch, then read the real SGLang source and land your first PR. Available in English and Chinese.