Deepseek R1 Zero learns to reason using reinforcement learning on base model [pdf](github.com)
github.com
Deepseek R1 Zero learns to reason using reinforcement learning on base model [pdf]
https://github.com/deepseek-ai/DeepSeek-R1/blob/main/DeepSeek_R1.pdf
1 comments
[deleted]