Hugging Face TRL
Hugging Face TRL 是面向训练数据、模型预训练、微调、对齐、实验或模型生命周期的 AI 模型训练工具。
分类:开源后训练 / SFT、偏好与 RL
公司 / 团队:Hugging Face
详细介绍
该产品的主要能力包括SFT、DPO、GRPO、PPO、KTO、Reward Modeling、工具和 Agent 训练、PEFT、DeepSpeed、Liger 与 vLLM 集成。
模型训练质量受到数据、模板、Tokenizer、超参数、并行策略、硬件、随机种子和评估方法影响。详情页应把支持模型、训练方法、硬件、数据格式、许可证、费用、版本和复现条件拆成动态字段维护。
适合场景
- 开源 LLM 对齐
- 推理模型
- 偏好学习
- 奖励模型
- 研究和自定义训练循环
使用注意
- 不同 Trainer 的数据格式和目标不同
- Reward Hacking 和训练不稳定需专项监控
- 版本升级可能改变参数和默认值
- 训练产物上线前应通过独立评测、安全测试、人工审核和真实流量灰度验证。