Entrenamiento RL de LLM con verl

Guía para entrenar LLM con aprendizaje por refuerzo usando verl (Volcano Engine RL), aplicando RLHF, GRPO, PPO y otros algoritmos a escala con backends de infr…

/skills/post-training-verl