-
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
Paper • 2607.14777 • Published • 102 -
Self-Improvements in Modern Agentic Systems: A Survey
Paper • 2607.13104 • Published • 31 -
Loop the Loopies!
Paper • 2607.16051 • Published • 71 -
When Does Muon Help Agentic Reinforcement Learning?
Paper • 2607.16169 • Published • 14
Collections
Discover the best community collections!
Collections including paper arxiv:2607.13104
-
Self-Supervised Prompt Optimization
Paper • 2502.06855 • Published • 18 -
Context Learning for Multi-Agent Discussion
Paper • 2602.02350 • Published • 4 -
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
Paper • 2603.12056 • Published • 34 -
Online Experiential Learning for Language Models
Paper • 2603.16856 • Published • 60
-
Large Language Models Orchestrating Structured Reasoning Achieve Kaggle Grandmaster Level
Paper • 2411.03562 • Published • 70 -
Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning
Paper • 2502.06060 • Published • 37 -
MLGym: A New Framework and Benchmark for Advancing AI Research Agents
Paper • 2502.14499 • Published • 196 -
SurveyX: Academic Survey Automation via Large Language Models
Paper • 2502.14776 • Published • 100
-
LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing
Paper • 2606.06042 • Published • 24 -
Optimizing Visual Generative Models via Distribution-wise Rewards
Paper • 2607.02291 • Published • 18 -
Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
Paper • 2607.13285 • Published • 226 -
Self-Improvements in Modern Agentic Systems: A Survey
Paper • 2607.13104 • Published • 31
-
Self-Taught Self-Correction for Small Language Models
Paper • 2503.08681 • Published • 16 -
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
Paper • 2605.14539 • Published • 8 -
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
Paper • 2607.14777 • Published • 102 -
Self-Improvements in Modern Agentic Systems: A Survey
Paper • 2607.13104 • Published • 31
-
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
Paper • 2607.14777 • Published • 102 -
Self-Improvements in Modern Agentic Systems: A Survey
Paper • 2607.13104 • Published • 31 -
Loop the Loopies!
Paper • 2607.16051 • Published • 71 -
When Does Muon Help Agentic Reinforcement Learning?
Paper • 2607.16169 • Published • 14
-
LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing
Paper • 2606.06042 • Published • 24 -
Optimizing Visual Generative Models via Distribution-wise Rewards
Paper • 2607.02291 • Published • 18 -
Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
Paper • 2607.13285 • Published • 226 -
Self-Improvements in Modern Agentic Systems: A Survey
Paper • 2607.13104 • Published • 31
-
Self-Supervised Prompt Optimization
Paper • 2502.06855 • Published • 18 -
Context Learning for Multi-Agent Discussion
Paper • 2602.02350 • Published • 4 -
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
Paper • 2603.12056 • Published • 34 -
Online Experiential Learning for Language Models
Paper • 2603.16856 • Published • 60
-
Self-Taught Self-Correction for Small Language Models
Paper • 2503.08681 • Published • 16 -
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
Paper • 2605.14539 • Published • 8 -
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
Paper • 2607.14777 • Published • 102 -
Self-Improvements in Modern Agentic Systems: A Survey
Paper • 2607.13104 • Published • 31
-
Large Language Models Orchestrating Structured Reasoning Achieve Kaggle Grandmaster Level
Paper • 2411.03562 • Published • 70 -
Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning
Paper • 2502.06060 • Published • 37 -
MLGym: A New Framework and Benchmark for Advancing AI Research Agents
Paper • 2502.14499 • Published • 196 -
SurveyX: Academic Survey Automation via Large Language Models
Paper • 2502.14776 • Published • 100