Научная реализация метода ускоренной генерации текста большими языковыми моделями через предсказание черновиков.
AdaFlash — исследовательский код к статье об ускорении работы больших языковых моделей: вспомогательная модель заранее готовит черновик ответа, а основная модель его проверяет и исправляет, что экономит время. Проект включает готовые настройки для моделей семейства Qwen3 и инструменты для сравнения скорости с другими методами. Предназначен для инженеров и исследователей, занимающихся ускорением ИИ-моделей.
Описание автора:[COLMW'26] AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters