01
LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback
LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback
Reinforcement Learning (RL) systems are typically trained using a single, well-specified scalar reward function.