Hacker Newsnew | past | comments | ask | show | jobs | submitlogin

Because they’ve essentially exhausted pre training scaling and are looking to post training to expand capabilities, which is really just optimization via reinforcement learning against specific tasks aka bench maxing.
 help



Guidelines | FAQ | Lists | API | Security | Legal | Apply to YC | Contact

Search: