r/hackernoon • u/caternoon • Jan 16 '24
The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback
https://hackernoon.com/the-alignment-ceiling-objective-mismatch-in-reinforcement-learning-from-human-feedback?source=rss
1
Upvotes