Live data from Hacker News

Deepseek R1 Zero learns to reason using reinforcement learning on base model [pdf]

github.com

1–2 of 2 posts