Хакатон-проект по дообучению небольшой ИИ-модели Nemotron с помощью более крупной модели-учителя.
Проект показывает технику дистилляции знаний: маленькая модель Nemotron 3.5 Lightning отвечает на научные вопросы, а крупная модель Nemotron 3 Ultra оценивает каждый её ответ, после чего Lightning дообучается на этой разнице через LoRA-адаптер. После 27 циклов обучения точность на тесте GPQA Diamond выросла с 64,14% до 67,17% почти без потери скорости работы модели. Сделан как проект хакатона SteelHacks.
Описание автора:On-policy distillation of Nemotron 3.5 Lightning from Nemotron 3 Ultra | SteelHacks hackathon project