RLHF de alto rendimiento con OpenRLHF

Framework de RLHF acelerado con Ray y vLLM para entrenar modelos grandes (7B-70B+) con PPO, GRPO, RLOO y DPO, hasta 2× más rápido que DeepSpeedChat gracias a s…

/skills/post-training-openrlhf