UnfaithRL/OLMo-2-0425-1B-code_problems_hint_following-1024 Reinforcement Learning • 1B • Updated Jul 8 • 8
UnfaithRL/OLMo-2-0425-1B-code_problems_hint_following-2048 Reinforcement Learning • 1B • Updated Jul 8 • 8
UnfaithRL/OLMo-2-0425-1B-hybrid_accuracy_hint_reward-512 Reinforcement Learning • 1B • Updated Jul 8 • 11
UnfaithRL/OLMo-2-0425-1B-hybrid_accuracy_hint_reward-1024 Reinforcement Learning • 1B • Updated Jul 8 • 8
UnfaithRL/OLMo-2-0425-1B-hybrid_accuracy_hint_reward-2048 Reinforcement Learning • 1B • Updated Jul 8 • 9
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_relaxed_v7-512 Reinforcement Learning • 1B • Updated Jul 8 • 6
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_relaxed_v7-1024 Reinforcement Learning • 1B • Updated Jul 8 • 6
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_relaxed_v7-2048 Reinforcement Learning • 1B • Updated Jul 8 • 12
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_strict_v9-512 Reinforcement Learning • 1B • Updated Jul 8 • 9
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_strict_v9-1024 Reinforcement Learning • 1B • Updated Jul 8 • 8
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_strict_v9-2048 Reinforcement Learning • 1B • Updated Jul 8 • 8