Библиотека для обучения больших языковых моделей методом reinforcement learning, разработанная командой ByteDance Seed.
verl (Volcano Engine Reinforcement Learning) — открытая библиотека для RL-обучения языковых моделей, поддерживающая алгоритмы GRPO и PPO в несколько строк кода. Она интегрируется с популярными инфраструктурами вроде FSDP, Megatron-LM, vLLM и SGLang, гибко распределяет модели по GPU и совместима с моделями Hugging Face. Используется исследователями и инженерами, которым нужна производительная и масштабируемая RL-платформа для дообучения LLM.
Описание автора:verl/HybridFlow: A Flexible and Efficient RL Post-Training Framework
Python★ 509создан 21 сентября 2026форков 53Apache-2.0