Deepseek R1 Zero learns to reason using reinforcement learning on base model [pdf] #1 Post by virde » Mon, Jan 20, 2025, 12:38 PM UTC Deepseek R1 Zero learns to reason using reinforcement learning on base model [pdf]github.com
Re: Deepseek R1 Zero learns to reason using reinforcement learning on base model [pdf] #2 Post by [deleted] » Mon, Jan 20, 2025, 1:37 PM UTC [deleted]