Код к научной статье об обучении критика в алгоритме PPO — как избежать «выравнивания» оценок ценности.
Автор не дал общего описания проекта; из README видно, что это официальный репозиторий к статье об обучении критика в PPO (Rethinking Critic Learning in PPO) и способах бороться с проблемой выравнивания значений. Репозиторий на Python построен поверх фреймворка slime и включает пример запуска эксперимента с моделью Qwen3-4B на восьми GPU. Предназначен для исследователей в области обучения с подкреплением для языковых моделей.
Python★ 8создан 15 сентября 2026форков 0Apache-2.0