Открытый проект чипа для инференса языковых моделей — один слой трансформера в RTL, проверен на FPGA с моделью Qwen2.5-0.5B.
Проект реализует один слой декодера трансформера — внимание, сжатие KV-кеша, softmax, нормализацию — как аппаратную схему (RTL), побитово сверенную с эталонной программной моделью. Схема запущена на FPGA и прогоняет реальную модель Qwen через проверенный конвейер, показывая измеренную скорость 0,56 токена в секунду. Автор чётко разделяет измеренные и прогнозируемые показатели, приводя доказательства для каждого числа.
Описание автора:An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer decoder layer in RTL, every silicon value bit-exact against a golden model. 0.56 tok/s measured, a 140× climb, full evidence trail.
Python★ 615создан 17 августа 2026форков 11Apache-2.0