Less is More: Recursive Reasoning with Tiny Networks Paper • 2510.04871 • Published Oct 6, 2025 • 519
Weak-to-Strong Generalization via Direct On-Policy Distillation Paper • 2607.05394 • Published 30 days ago • 140
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement Paper • 2607.23802 • Published 12 days ago • 99