RLHF de alto rendimiento con OpenRLHF
Framework de RLHF acelerado con Ray y vLLM para entrenar modelos grandes (7B-70B+) con PPO, GRPO, RLOO y DPO, hasta 2× más rápido que DeepSpeedChat gracias a s…
Framework de RLHF acelerado con Ray y vLLM para entrenar modelos grandes (7B-70B+) con PPO, GRPO, RLOO y DPO, hasta 2× más rápido que DeepSpeedChat gracias a s…