Add evaluation results

#22
by SaylorTwift HF Staff - opened

YAML Metadata Error:Invalid content in Eval Result file .eval_results/Qwen3.8-27B.yaml

Check out the documentation for more information.

Show details
Task ID "hle" does not match any task in dataset "cais/hle". Available: none
Files changed (1) hide show
  1. .eval_results/Qwen3.8-27B.yaml +47 -0
.eval_results/Qwen3.8-27B.yaml ADDED
@@ -0,0 +1,47 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ - dataset:
2
+ id: ScaleAI/SWE-bench_Pro
3
+ task_id: SWE_Bench_Pro
4
+ value: 61.7
5
+ date: "2026-08-14"
6
+ source:
7
+ url: https://huggingface.co/Qwen/Qwen3.8-27B
8
+ name: "Qwen3.8-27B model card"
9
+ notes: "Evaluated with the Claude Code harness, temp=1.0, top_p=0.95, 256K context; baseline models re-evaluated on the same refined task set."
10
+
11
+ - dataset:
12
+ id: datacurve/deep-swe
13
+ task_id: deep_swe
14
+ value: 42.2
15
+ date: "2026-08-14"
16
+ source:
17
+ url: https://huggingface.co/Qwen/Qwen3.8-27B
18
+ name: "Qwen3.8-27B model card"
19
+
20
+ - dataset:
21
+ id: Idavidrein/gpqa
22
+ task_id: diamond
23
+ value: 89.2
24
+ date: "2026-08-14"
25
+ source:
26
+ url: https://huggingface.co/Qwen/Qwen3.8-27B
27
+ name: "Qwen3.8-27B model card"
28
+
29
+ - dataset:
30
+ id: cais/hle
31
+ task_id: hle
32
+ value: 30.8
33
+ date: "2026-08-14"
34
+ source:
35
+ url: https://huggingface.co/Qwen/Qwen3.8-27B
36
+ name: "Qwen3.8-27B model card"
37
+ notes: "Judged by GPT-4o."
38
+
39
+ - dataset:
40
+ id: claw-eval/Claw-Eval
41
+ task_id: multimodal
42
+ value: 57.4
43
+ date: "2026-08-14"
44
+ source:
45
+ url: https://huggingface.co/Qwen/Qwen3.8-27B
46
+ name: "Qwen3.8-27B model card"
47
+ notes: "Reported as ClawEval-MM. Pass@3, the benchmark's own Pass³ methodology; card also reports a secondary 56.9 'Average' metric, not included here."