trl 收录了来自 huggingface 的 1 个 skills,并提供仓库级职业覆盖和站内 skill 详情页。
Train and fine-tune transformer language models using TRL (Transformers Reinforcement Learning). Supports SFT, DPO, GRPO, KTO, RLOO and Reward Model training via CLI commands.