TRL (Transformer Reinforcement Learning) for SFT, RLHF, DPO training. Use for supervised fine-tuning, reward modeling, RLHF (PPO), and Direct Preference Optimization (DPO). Best for training instructi
Slug: trl
trl
gamAI — 4177+ skillova za agente · MCP · alati