thu-ml /SageAttention
Ускоряет работу нейросетей (текст, картинки, видео) за счёт более быстрого механизма внимания, без потери качества.
SageAttention — это оптимизированный способ вычисления механизма внимания внутри больших нейросетей, который использует сжатые числовые форматы (квантование) вместо привычных, за счёт чего работает в 2-5 раз быстрее популярного метода FlashAttention. Проект подходит разработчикам, которые обучают или запускают языковые, графические и видеомодели и хотят сократить время и стоимость вычислений, сохранив точность результатов. Поддерживает современные видеокарты Nvidia и интеграцию с torch.compile.
Описание автора: [ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention achieves speedup of 2-5x compared to FlashAttention, without losing end-to-end metrics across language, image, and video models.
Сколько звёзд прибавилось
- Сутки ≈ +161 211-е место
- Неделя +140 1743-е место
- Месяц ≈ +246 вне рейтинга
- 3 месяца ≈ +363 вне рейтинга
Без значка — точная разница ежедневных снимков счётчика GitHub, со значком ≈ — оценка по архиву событий.
Точный счётчик GitHub: +152 звезды с 00:33 16 сентября по 14:20 23 сентября.
Прирост по дням за 3 месяца
Оценка по выборке GH Archive. Бледные столбцы — дни, история за которые ещё загружается.