We’ve been approaching reward supervision for robots the wrong way.

We’ve been approaching reward supervision for robots the wrong way.

I think freeform preferences are part of the answer.

A short 🧵 https://t.co/9DZbaf1mNX

https://bender.layer3.press/articles/019f364e-d1e2-0134-707f-34394dda4389

Write a comment