Fine-tuning con GRPO/RL

Guía experta para el fine-tuning con GRPO/RL usando TRL, orientado al razonamiento y al entrenamiento de modelos para tareas específicas.

/skills/post-training-grpo-rl-training