We’ve been approaching reward supervision for robots the wrong way.
We’ve been approaching reward supervision for robots the wrong way.
I think freeform preferences are part of the answer.
A short 🧵 https://t.co/9DZbaf1mNX

https://bender.layer3.press/articles/019f364e-d1e2-0134-707f-34394dda4389
Write a comment