Submitted by taesiri 21 Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling Qwen 4
Submitted by taesiri 146 Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments Qwen 3
Submitted by Bowen Wang 35 CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents Qwen 180 2
Submitted by huxiaomeng 69 OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language World Models Qwen 21 3
Submitted by zjj 30 RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation Qwen 62 2
Submitted by taesiri 11 Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs Qwen 1
Submitted by taesiri 29 On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation Qwen 17 2
Submitted by Kexin Huang 353 FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization Qwen 130 8
Submitted by Shenzhi Wang 110 HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning Qwen 5