Remix clone Hacker News
new
|
show
|
ask
|
jobs
Github
▲
Ancapistani
6 hours ago
Reinforcement learning, I'd assume.
Presumably RLHF (Reinforcement Learning from Human Feedback).