Fine-tuning de LLMs con TRL
Ajusta LLMs mediante aprendizaje por refuerzo con TRL: SFT para instruction tuning, DPO para alineación por preferencias, PPO/GRPO para optimización de recompe…
Ajusta LLMs mediante aprendizaje por refuerzo con TRL: SFT para instruction tuning, DPO para alineación por preferencias, PPO/GRPO para optimización de recompe…