Preprint2026
Decoding-Time Debiasing via Process Reward Models: From Controlled Fill-in to Open-Ended Generation
Unknown
This paper introduces a decoding-time debiasing method using process reward models to reduce social biases in LLM generation, from fill-in tasks to open-ended generation.
0Jan 1, 2026Large Language Models