Fine-tuning de LLMs con TRL

Ajusta LLMs mediante aprendizaje por refuerzo con TRL: SFT para instruction tuning, DPO para alineación por preferencias, PPO/GRPO para optimización de recompe…

/skills/post-training-trl-fine-tuning