Открытый фреймворк для обучения больших языковых и мультимодальных моделей — от предобучения до асинхронного RL.
Halo — открытый фреймворк компании White Circle для обучения больших языковых и мультимодальных моделей: предобучение, дообучение (SFT), оптимизация под предпочтения и полностью асинхронное обучение с подкреплением в несколько ходов диалога. Работает как на одной видеокарте, так и на кластере из нескольких узлов, напрямую обучает модели Hugging Face — чекпоинты остаются совместимы с from_pretrained. По заявлению авторов, на 8 картах B300 Halo даёт до 2,8 раза большую скорость обучения, чем стандартный TRL.
Описание автора:Halo is an open-source framework built by White Circle for training large language and multimodal models