- dataset: id: ScaleAI/SWE-bench_Pro task_id: SWE_Bench_Pro value: 56.5 source: url: https://huggingface.co/OrionLLM/GRM-2.7-Mythos name: Official GRM-2.7 Benchmark user: DedeProGames