PreprintarXiv.org2025
REFINE-AF
Aniruddha Roy, Pretam Ray, Abhilash Nandy, et al.
REFINE-AF uses reinforcement learning from automated feedback to generate high-quality instruction datasets from a small seed set, outperforming Self-Instruct.
1May 1, 2025Fine TuningReinforcement Learning
arXiv