haochengsama commited on
Commit
03666d2
·
verified ·
1 Parent(s): be3145f

backfill batch 13 (400)

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu5.log +50 -0
  2. eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu6.log +50 -0
  3. eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu7.log +50 -0
  4. eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu0.log +50 -0
  5. eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu1.log +50 -0
  6. eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu2.log +50 -0
  7. eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu3.log +50 -0
  8. eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu4.log +50 -0
  9. eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu5.log +50 -0
  10. eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu6.log +50 -0
  11. eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu7.log +50 -0
  12. eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu0.log +50 -0
  13. eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu1.log +50 -0
  14. eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu2.log +50 -0
  15. eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu3.log +50 -0
  16. eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu4.log +50 -0
  17. eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu5.log +50 -0
  18. eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu6.log +50 -0
  19. eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu7.log +50 -0
  20. eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu0.log +50 -0
  21. eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu1.log +50 -0
  22. eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu2.log +50 -0
  23. eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu3.log +50 -0
  24. eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu4.log +50 -0
  25. eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu5.log +50 -0
  26. eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu6.log +50 -0
  27. eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu7.log +50 -0
  28. eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu0.log +53 -0
  29. eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu1.log +53 -0
  30. eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu2.log +53 -0
  31. eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu3.log +53 -0
  32. eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu4.log +53 -0
  33. eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu5.log +53 -0
  34. eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu6.log +53 -0
  35. eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu7.log +53 -0
  36. eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu0.log +53 -0
  37. eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu1.log +53 -0
  38. eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu2.log +53 -0
  39. eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu3.log +53 -0
  40. eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu4.log +53 -0
  41. eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu5.log +53 -0
  42. eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu6.log +53 -0
  43. eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu7.log +53 -0
  44. eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu0.log +53 -0
  45. eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu1.log +53 -0
  46. eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu2.log +53 -0
  47. eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu3.log +53 -0
  48. eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu4.log +53 -0
  49. eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu5.log +53 -0
  50. eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu6.log +53 -0
eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu5.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.1
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 128)
7
+ sampled 128/128 (steps this call: 128)
8
+ Average denoising rounds per sample: 128.00
9
+ First sample preview: ' said.\n\n"The the process is going to be there,” Lehman said.\n\nIn the first phase of the new plan, the City Council will '
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 0.6509510393194246,
25
+ "median_nll": 0.03751843422651291,
26
+ "ppl": 1.9173634502150882,
27
+ "acc": 0.8601345708387829,
28
+ "tokens": 63461,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 128.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.1
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.1_gpu5.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.1_gpu5.json
42
+ Diversity metrics for pps4_lam0.6_temp0.1_gpu5.json:
43
+ distinct_1: 0.0353
44
+ repetition_1: 0.9000
45
+ distinct_2: 0.0966
46
+ repetition_2: 0.8364
47
+ distinct_4: 0.2286
48
+ repetition_4: 0.7112
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.1_gpu5.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu6.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.1
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 128)
7
+ sampled 128/128 (steps this call: 128)
8
+ Average denoising rounds per sample: 128.00
9
+ First sample preview: ' FBI to reopen the case.\n\nBut he said, that is not the case.\n\nThe report said, which was released Tuesday, that the FBI '
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 0.6457859240297437,
25
+ "median_nll": 0.031859297305345535,
26
+ "ppl": 1.9074855790746221,
27
+ "acc": 0.868684457599338,
28
+ "tokens": 62841,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 128.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.1
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.1_gpu6.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.1_gpu6.json
42
+ Diversity metrics for pps4_lam0.6_temp0.1_gpu6.json:
43
+ distinct_1: 0.0377
44
+ repetition_1: 0.9133
45
+ distinct_2: 0.1010
46
+ repetition_2: 0.8568
47
+ distinct_4: 0.2161
48
+ repetition_4: 0.7502
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.1_gpu6.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu7.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.1
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 128)
7
+ sampled 128/128 (steps this call: 128)
8
+ Average denoising rounds per sample: 128.00
9
+ First sample preview: '\n\n\nof the\n\nof the\n\n\n\n\n\n of the\n\nand of the\n\n\n\n\n\n\n\n\n\nof the\n\nof\n\nof\n\n\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof the'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 0.6516889086104449,
25
+ "median_nll": 0.0424233041703701,
26
+ "ppl": 1.9187787359084396,
27
+ "acc": 0.8566443038579828,
28
+ "tokens": 62753,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 128.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.1
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.1_gpu7.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.1_gpu7.json
42
+ Diversity metrics for pps4_lam0.6_temp0.1_gpu7.json:
43
+ distinct_1: 0.0319
44
+ repetition_1: 0.8956
45
+ distinct_2: 0.0932
46
+ repetition_2: 0.8163
47
+ distinct_4: 0.2333
48
+ repetition_4: 0.6856
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.1_gpu7.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu0.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.4
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 131)
7
+ sampled 128/128 (steps this call: 134)
8
+ Average denoising rounds per sample: 132.50
9
+ First sample preview: 'BBR Inc., Inc.BBR, Inc. is.\n\n(USA, Canada, Australia, New York, USA)\n\nThe company BBR Inc. , Inc.\n\nBBR Inc. is.\n\nBBR Inc'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 1.1519089559516735,
25
+ "median_nll": 0.17637917399406433,
26
+ "ppl": 3.1642275189102804,
27
+ "acc": 0.7490172314672384,
28
+ "tokens": 64359,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 132.5,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.4
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu0.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu0.json
42
+ Diversity metrics for pps4_lam0.6_temp0.4_gpu0.json:
43
+ distinct_1: 0.0671
44
+ repetition_1: 0.8292
45
+ distinct_2: 0.2072
46
+ repetition_2: 0.6862
47
+ distinct_4: 0.4266
48
+ repetition_4: 0.4948
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu0.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu1.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.4
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 131)
7
+ sampled 128/128 (steps this call: 129)
8
+ Average denoising rounds per sample: 130.00
9
+ First sample preview: 'Dear friends,\n\n\nsum’ to been a great year to us, the Reddit community, and the the community of Reddit it.\n\nWe’ve had a '
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 1.1469716861952688,
25
+ "median_nll": 0.14914770424365997,
26
+ "ppl": 3.1486433772917226,
27
+ "acc": 0.7549979663986485,
28
+ "tokens": 63926,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 130.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.4
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu1.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu1.json
42
+ Diversity metrics for pps4_lam0.6_temp0.4_gpu1.json:
43
+ distinct_1: 0.0805
44
+ repetition_1: 0.7894
45
+ distinct_2: 0.2360
46
+ repetition_2: 0.6363
47
+ distinct_4: 0.4586
48
+ repetition_4: 0.4540
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu1.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu2.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.4
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 136)
7
+ sampled 128/128 (steps this call: 132)
8
+ Average denoising rounds per sample: 134.00
9
+ First sample preview: ' the some of the tutorial on how to make the the..\n\nThe design of a the. is not the same as the design of a the. .\n\nThe '
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 1.147666217670304,
25
+ "median_nll": 0.1741468757390976,
26
+ "ppl": 3.1508309688085583,
27
+ "acc": 0.7498316340114959,
28
+ "tokens": 63849,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 134.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.4
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu2.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu2.json
42
+ Diversity metrics for pps4_lam0.6_temp0.4_gpu2.json:
43
+ distinct_1: 0.0745
44
+ repetition_1: 0.8154
45
+ distinct_2: 0.2242
46
+ repetition_2: 0.6672
47
+ distinct_4: 0.4587
48
+ repetition_4: 0.4786
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu2.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu3.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.4
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 133)
7
+ sampled 128/128 (steps this call: 132)
8
+ Average denoising rounds per sample: 132.50
9
+ First sample preview: 'U.S.S. is the best in the world, but not at the best of the world, to say according to the BBC. In a report released Tue'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 1.14529267073261,
25
+ "median_nll": 0.17469988763332367,
26
+ "ppl": 3.1433611920511138,
27
+ "acc": 0.7467620517136578,
28
+ "tokens": 64161,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 132.5,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.4
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu3.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu3.json
42
+ Diversity metrics for pps4_lam0.6_temp0.4_gpu3.json:
43
+ distinct_1: 0.0750
44
+ repetition_1: 0.8150
45
+ distinct_2: 0.2269
46
+ repetition_2: 0.6603
47
+ distinct_4: 0.4797
48
+ repetition_4: 0.4461
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu3.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu4.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.4
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 133)
7
+ sampled 128/128 (steps this call: 132)
8
+ Average denoising rounds per sample: 132.50
9
+ First sample preview: '\n.\n\n,\n\n\n.\n\n.\n\n.\n\n\n.\n\n\n.\n\n.\n\n.\n\n\n.\n\n\n.\n\n.\n\n\n.\n\n.\n\n.\n\n.\n\n.\n\n\n\n.\n\n.\n\n.\n\n.\n\n. .\n\n.\n\n.\n\n.\n\n. .\n\n.\n\n.\n\n.\n\n.\n\n. .\n\n.\n\n.\n\n\n.\n\n.\n'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 1.0779396125068843,
25
+ "median_nll": 0.14342989027500153,
26
+ "ppl": 2.938618616228597,
27
+ "acc": 0.7666852834403798,
28
+ "tokens": 64458,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 132.5,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.4
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu4.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu4.json
42
+ Diversity metrics for pps4_lam0.6_temp0.4_gpu4.json:
43
+ distinct_1: 0.0702
44
+ repetition_1: 0.8305
45
+ distinct_2: 0.2145
46
+ repetition_2: 0.6865
47
+ distinct_4: 0.4504
48
+ repetition_4: 0.4812
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu4.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu5.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.4
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 133)
7
+ sampled 128/128 (steps this call: 133)
8
+ Average denoising rounds per sample: 133.00
9
+ First sample preview: ' said.\n\n"The.C.R. is out of the game," he said.\n\nBut a company close to the company said the company is committed to wor'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 1.1531354440872796,
25
+ "median_nll": 0.16500601172447205,
26
+ "ppl": 3.16811078732511,
27
+ "acc": 0.7510950384237681,
28
+ "tokens": 64153,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 133.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.4
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu5.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu5.json
42
+ Diversity metrics for pps4_lam0.6_temp0.4_gpu5.json:
43
+ distinct_1: 0.0797
44
+ repetition_1: 0.8124
45
+ distinct_2: 0.2423
46
+ repetition_2: 0.6581
47
+ distinct_4: 0.4821
48
+ repetition_4: 0.4636
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu5.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu6.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.4
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 130)
7
+ sampled 128/128 (steps this call: 131)
8
+ Average denoising rounds per sample: 130.50
9
+ First sample preview: ' was released for the North version of the game last year, following the release of Wii U.\n\nThere is a new version, howe'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 1.1192875892864118,
25
+ "median_nll": 0.16515083611011505,
26
+ "ppl": 3.062671545889563,
27
+ "acc": 0.7531603043892683,
28
+ "tokens": 63997,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 130.5,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.4
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu6.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu6.json
42
+ Diversity metrics for pps4_lam0.6_temp0.4_gpu6.json:
43
+ distinct_1: 0.0701
44
+ repetition_1: 0.8150
45
+ distinct_2: 0.2151
46
+ repetition_2: 0.6697
47
+ distinct_4: 0.4521
48
+ repetition_4: 0.4745
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu6.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu7.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.4
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 132)
7
+ sampled 128/128 (steps this call: 132)
8
+ Average denoising rounds per sample: 132.00
9
+ First sample preview: ',” in the decision to appeal the decision.\n\nThe court gave the aisies the two days to make the decision on the case, the'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 1.1630522965856211,
25
+ "median_nll": 0.20357447117567062,
26
+ "ppl": 3.1996847732230664,
27
+ "acc": 0.7394515756269715,
28
+ "tokens": 64038,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 132.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.4
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu7.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu7.json
42
+ Diversity metrics for pps4_lam0.6_temp0.4_gpu7.json:
43
+ distinct_1: 0.0792
44
+ repetition_1: 0.7923
45
+ distinct_2: 0.2420
46
+ repetition_2: 0.6238
47
+ distinct_4: 0.4965
48
+ repetition_4: 0.4170
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu7.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu0.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.7
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 180)
7
+ sampled 128/128 (steps this call: 183)
8
+ Average denoising rounds per sample: 181.50
9
+ First sample preview: ' and I’ve seen the victims of and the victims murdered in the Los Angeles area.” So what else…\n\nThe next day we responde'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 2.942398785483946,
25
+ "median_nll": 2.017829656600952,
26
+ "ppl": 18.961275835862214,
27
+ "acc": 0.44926435249065905,
28
+ "tokens": 64501,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 181.5,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.7
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu0.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu0.json
42
+ Diversity metrics for pps4_lam0.6_temp0.7_gpu0.json:
43
+ distinct_1: 0.1963
44
+ repetition_1: 0.5336
45
+ distinct_2: 0.6266
46
+ repetition_2: 0.2041
47
+ distinct_4: 0.9265
48
+ repetition_4: 0.0655
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu0.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu1.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.7
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 183)
7
+ sampled 128/128 (steps this call: 174)
8
+ Average denoising rounds per sample: 178.50
9
+ First sample preview: 'Google Flipboard\n\nTwitter\n\nGoogle\n\n\nLinkedIn\n\nReddit Plus\n\ngoogle\n\n\n\nFacebook\n\n\n\nEmail\n\nGuest Note:\n\nThanks, Laura Lee, '
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 2.9454587164628476,
25
+ "median_nll": 2.053232431411743,
26
+ "ppl": 19.01938489069995,
27
+ "acc": 0.44612356241668993,
28
+ "tokens": 64518,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 178.5,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.7
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu1.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu1.json
42
+ Diversity metrics for pps4_lam0.6_temp0.7_gpu1.json:
43
+ distinct_1: 0.1902
44
+ repetition_1: 0.5426
45
+ distinct_2: 0.6052
46
+ repetition_2: 0.2125
47
+ distinct_4: 0.9222
48
+ repetition_4: 0.0645
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu1.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu2.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.7
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 175)
7
+ sampled 128/128 (steps this call: 170)
8
+ Average denoising rounds per sample: 172.50
9
+ First sample preview: ' the trip to the USA by the NNVE backing group to create it. The story was the template for NNVE.\n\nAnd the mysterious be'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 2.7603239347687127,
25
+ "median_nll": 1.7485754489898682,
26
+ "ppl": 15.804961895789319,
27
+ "acc": 0.48433919022154315,
28
+ "tokens": 64141,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 172.5,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.7
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu2.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu2.json
42
+ Diversity metrics for pps4_lam0.6_temp0.7_gpu2.json:
43
+ distinct_1: 0.1953
44
+ repetition_1: 0.5519
45
+ distinct_2: 0.6067
46
+ repetition_2: 0.2377
47
+ distinct_4: 0.9070
48
+ repetition_4: 0.0826
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu2.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu3.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.7
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 173)
7
+ sampled 128/128 (steps this call: 175)
8
+ Average denoising rounds per sample: 174.00
9
+ First sample preview: 'If you are staying in hotel on Monday in UAMA, you have until at least 10:13 am Sunday on March 18 to get there. If a pl'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 2.8654510964581106,
25
+ "median_nll": 1.9266316890716553,
26
+ "ppl": 17.55697130610988,
27
+ "acc": 0.46492573145609717,
28
+ "tokens": 64563,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 174.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.7
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu3.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu3.json
42
+ Diversity metrics for pps4_lam0.6_temp0.7_gpu3.json:
43
+ distinct_1: 0.1934
44
+ repetition_1: 0.5501
45
+ distinct_2: 0.6095
46
+ repetition_2: 0.2326
47
+ distinct_4: 0.9177
48
+ repetition_4: 0.0795
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu3.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu4.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.7
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 186)
7
+ sampled 128/128 (steps this call: 177)
8
+ Average denoising rounds per sample: 181.50
9
+ First sample preview: ' and, the electrician wanted to keep his eyes on the a Tesla. For a moment, if he was ever the same side with his driver'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 2.929448415530568,
25
+ "median_nll": 2.029412031173706,
26
+ "ppl": 18.717303474915926,
27
+ "acc": 0.44909500504932803,
28
+ "tokens": 64365,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 181.5,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.7
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu4.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu4.json
42
+ Diversity metrics for pps4_lam0.6_temp0.7_gpu4.json:
43
+ distinct_1: 0.2037
44
+ repetition_1: 0.5318
45
+ distinct_2: 0.6382
46
+ repetition_2: 0.2019
47
+ distinct_4: 0.9355
48
+ repetition_4: 0.0559
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu4.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu5.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.7
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 174)
7
+ sampled 128/128 (steps this call: 176)
8
+ Average denoising rounds per sample: 175.00
9
+ First sample preview: 'Dell Vogts and Schmitz flew a three-year-old space shuttle, in orbit, but the company—fueled up to the and now active on'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 2.893385421106573,
25
+ "median_nll": 1.985037088394165,
26
+ "ppl": 18.05432775945453,
27
+ "acc": 0.45797362017390225,
28
+ "tokens": 64519,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 175.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.7
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu5.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu5.json
42
+ Diversity metrics for pps4_lam0.6_temp0.7_gpu5.json:
43
+ distinct_1: 0.1917
44
+ repetition_1: 0.5309
45
+ distinct_2: 0.6122
46
+ repetition_2: 0.2127
47
+ distinct_4: 0.9240
48
+ repetition_4: 0.0702
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu5.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu6.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.7
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 174)
7
+ sampled 128/128 (steps this call: 180)
8
+ Average denoising rounds per sample: 177.00
9
+ First sample preview: '.”\n\nagainst\n\nthe hand, though, a bayonet is used to throw a punch. I had a claw handle and was\nduc using it,\n\nand he swu'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 2.8696047275553243,
25
+ "median_nll": 1.9438047409057617,
26
+ "ppl": 17.630048150161716,
27
+ "acc": 0.4609834731438588,
28
+ "tokens": 63896,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 177.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.7
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu6.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu6.json
42
+ Diversity metrics for pps4_lam0.6_temp0.7_gpu6.json:
43
+ distinct_1: 0.1961
44
+ repetition_1: 0.5396
45
+ distinct_2: 0.6178
46
+ repetition_2: 0.2154
47
+ distinct_4: 0.9188
48
+ repetition_4: 0.0717
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu6.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu7.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.7
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 179)
7
+ sampled 128/128 (steps this call: 177)
8
+ Average denoising rounds per sample: 178.00
9
+ First sample preview: '“Not always in the past,” said Evron Morales.\n\nA quote from two-quite-assed-people was long ago an unspoken part of the '
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 2.9287707690608333,
25
+ "median_nll": 2.006821036338806,
26
+ "ppl": 18.704624056859846,
27
+ "acc": 0.4540028525362768,
28
+ "tokens": 64504,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 178.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.7
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu7.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu7.json
42
+ Diversity metrics for pps4_lam0.6_temp0.7_gpu7.json:
43
+ distinct_1: 0.1917
44
+ repetition_1: 0.5379
45
+ distinct_2: 0.6068
46
+ repetition_2: 0.2181
47
+ distinct_4: 0.9081
48
+ repetition_4: 0.0819
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu7.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu0.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.8
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 210)
7
+ sampled 128/128 (steps this call: 201)
8
+ Average denoising rounds per sample: 205.50
9
+ First sample preview: ' and I’ve had three victims dead four more victims murdered in the Los Angeles area.” So what else might there go on Ear'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 3.9368979006805738,
25
+ "median_nll": 3.2145655155181885,
26
+ "ppl": 51.25934283792319,
27
+ "acc": 0.32915863345415286,
28
+ "tokens": 64835,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 205.5,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.8
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu0.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu0.json
42
+ Diversity metrics for pps4_lam0.6_temp0.8_gpu0.json:
43
+ distinct_1: 0.2465
44
+ repetition_1: 0.4214
45
+ distinct_2: 0.7338
46
+ repetition_2: 0.0834
47
+ distinct_4: 0.9898
48
+ repetition_4: 0.0081
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu0.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu1.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.8
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 206)
7
+ sampled 128/128 (steps this call: 204)
8
+ Average denoising rounds per sample: 205.00
9
+ First sample preview: 'Twenty-terrorist were killed during the clashes- the operation in Messed where eight ISIS sympathisers were being detain'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 3.9516018208961854,
25
+ "median_nll": 3.2193745374679565,
26
+ "ppl": 52.018624654934406,
27
+ "acc": 0.3302834533708386,
28
+ "tokens": 64702,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 205.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.8
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu1.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu1.json
42
+ Diversity metrics for pps4_lam0.6_temp0.8_gpu1.json:
43
+ distinct_1: 0.2552
44
+ repetition_1: 0.4202
45
+ distinct_2: 0.7408
46
+ repetition_2: 0.0838
47
+ distinct_4: 0.9866
48
+ repetition_4: 0.0113
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu1.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu2.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.8
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 209)
7
+ sampled 128/128 (steps this call: 208)
8
+ Average denoising rounds per sample: 208.50
9
+ First sample preview: 'Im a big fan of this (BEVE specifically) myself.\n\nBELL is an engine for 3D 8 (No obvious). I used Spiv 2 models (I are 1'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 3.9009848416018436,
25
+ "median_nll": 3.143462657928467,
26
+ "ppl": 49.45112665854749,
27
+ "acc": 0.3373799545335045,
28
+ "tokens": 64663,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 208.5,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.8
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu2.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu2.json
42
+ Diversity metrics for pps4_lam0.6_temp0.8_gpu2.json:
43
+ distinct_1: 0.2504
44
+ repetition_1: 0.4222
45
+ distinct_2: 0.7364
46
+ repetition_2: 0.0895
47
+ distinct_4: 0.9813
48
+ repetition_4: 0.0165
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu2.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu3.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.8
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 204)
7
+ sampled 128/128 (steps this call: 200)
8
+ Average denoising rounds per sample: 202.00
9
+ First sample preview: '\nHave he been attending Cancer Research on Aging (CAMA) in Chicago?\n\nIn the past week, though, he publicly revealed a fa'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 3.9212626953577887,
25
+ "median_nll": 3.1701507568359375,
26
+ "ppl": 50.464125381857606,
27
+ "acc": 0.334229930900153,
28
+ "tokens": 64689,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 202.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.8
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu3.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu3.json
42
+ Diversity metrics for pps4_lam0.6_temp0.8_gpu3.json:
43
+ distinct_1: 0.2498
44
+ repetition_1: 0.4203
45
+ distinct_2: 0.7356
46
+ repetition_2: 0.0824
47
+ distinct_4: 0.9892
48
+ repetition_4: 0.0084
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu3.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu4.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.8
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 206)
7
+ sampled 128/128 (steps this call: 204)
8
+ Average denoising rounds per sample: 205.00
9
+ First sample preview: ' and-turned electrician Mark Anderson narrowly opened fire on the a Mercedes that came out of a home at 275 in a downtow'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 3.9627575752168345,
25
+ "median_nll": 3.2250115871429443,
26
+ "ppl": 52.60218060308741,
27
+ "acc": 0.3245725044755849,
28
+ "tokens": 64796,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 205.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.8
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu4.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu4.json
42
+ Diversity metrics for pps4_lam0.6_temp0.8_gpu4.json:
43
+ distinct_1: 0.2448
44
+ repetition_1: 0.4107
45
+ distinct_2: 0.7334
46
+ repetition_2: 0.0736
47
+ distinct_4: 0.9900
48
+ repetition_4: 0.0071
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu4.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu5.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.8
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 200)
7
+ sampled 128/128 (steps this call: 202)
8
+ Average denoising rounds per sample: 201.00
9
+ First sample preview: 'ine W. Barker. While India’s aversion to Corydon is understandable, 1769 it parallels British resistance to Japanese, he'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 3.997569114385298,
25
+ "median_nll": 3.2696503400802612,
26
+ "ppl": 54.46558936083237,
27
+ "acc": 0.32421404061949366,
28
+ "tokens": 64698,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 201.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.8
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu5.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu5.json
42
+ Diversity metrics for pps4_lam0.6_temp0.8_gpu5.json:
43
+ distinct_1: 0.2539
44
+ repetition_1: 0.4116
45
+ distinct_2: 0.7402
46
+ repetition_2: 0.0813
47
+ distinct_4: 0.9861
48
+ repetition_4: 0.0116
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu5.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu6.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.8
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 202)
7
+ sampled 128/128 (steps this call: 203)
8
+ Average denoising rounds per sample: 202.50
9
+ First sample preview: '\n“z okept e” noise, though a .” I used the “it. I had just unmasked the Hearst happened on him, which it was just “i….i\n'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 3.9174913685951633,
25
+ "median_nll": 3.1576714515686035,
26
+ "ppl": 50.27416709777929,
27
+ "acc": 0.33555683105037,
28
+ "tokens": 64463,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 202.5,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.8
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu6.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu6.json
42
+ Diversity metrics for pps4_lam0.6_temp0.8_gpu6.json:
43
+ distinct_1: 0.2538
44
+ repetition_1: 0.4267
45
+ distinct_2: 0.7349
46
+ repetition_2: 0.0926
47
+ distinct_4: 0.9816
48
+ repetition_4: 0.0145
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu6.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu7.log ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
3
+ level_lambdas = [0.6]
4
+ leaf_temperature = 0.8
5
+ Generating 128 samples (L=512)...
6
+ sampled 64/128 (steps this call: 206)
7
+ sampled 128/128 (steps this call: 198)
8
+ Average denoising rounds per sample: 202.00
9
+ First sample preview: ' with reports from Politico and elsewhere. First, the New York Post reported that:\n\n\nReporting from Washington at the-ba'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 16/128
16
+ scored 32/128
17
+ scored 48/128
18
+ scored 64/128
19
+ scored 80/128
20
+ scored 96/128
21
+ scored 112/128
22
+ scored 128/128
23
+ {
24
+ "avg_nll": 3.962866495961764,
25
+ "median_nll": 3.223786234855652,
26
+ "ppl": 52.60791038382395,
27
+ "acc": 0.3319229106183211,
28
+ "tokens": 64756,
29
+ "checkpoint": "outputs/sad_block_ar/latest.pt",
30
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
31
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
32
+ "num_samples": 128,
33
+ "generated_seq_len": 512,
34
+ "mode": "sad_generation",
35
+ "level_lambdas": "0.6",
36
+ "avg_steps": 202.0,
37
+ "positions_per_step": 4,
38
+ "leaf_temperature": 0.8
39
+ }
40
+ Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu7.json
41
+ Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu7.json
42
+ Diversity metrics for pps4_lam0.6_temp0.8_gpu7.json:
43
+ distinct_1: 0.2596
44
+ repetition_1: 0.4171
45
+ distinct_2: 0.7469
46
+ repetition_2: 0.0821
47
+ distinct_4: 0.9917
48
+ repetition_4: 0.0060
49
+ num_samples: 128.0000
50
+ Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu7.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu0.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.94
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 249)
8
+ Average denoising rounds per sample: 249.00
9
+ First sample preview: " back to the point that we can't Page or verify, but a core said or aired. Nor did the would need to guard that the judg"
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.543587042971091,
21
+ "median_nll": 5.149930000305176,
22
+ "ppl": 255.59318080251396,
23
+ "acc": 0.19897951342462386,
24
+ "tokens": 65067,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 249.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.94
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu0.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu0.json
39
+ Diversity metrics for pps4_lam0.6_temp0.94_gpu0.json:
40
+ distinct_1: 0.3373
41
+ repetition_1: 0.3051
42
+ d1: 0.3373
43
+ r1: 0.3051
44
+ distinct_2: 0.8485
45
+ repetition_2: 0.0237
46
+ d2: 0.8485
47
+ r2: 0.0237
48
+ distinct_4: 0.9989
49
+ repetition_4: 0.0006
50
+ d4: 0.9989
51
+ r4: 0.0006
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu0.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu1.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.94
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 248)
8
+ Average denoising rounds per sample: 248.00
9
+ First sample preview: ', maybe a positive for their own transportation systems more efficient or acceptable. Personally, I believe that, after '
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.533697939093593,
21
+ "median_nll": 5.119769811630249,
22
+ "ppl": 253.07804997927,
23
+ "acc": 0.20001230277119922,
24
+ "tokens": 65026,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 248.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.94
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu1.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu1.json
39
+ Diversity metrics for pps4_lam0.6_temp0.94_gpu1.json:
40
+ distinct_1: 0.3277
41
+ repetition_1: 0.3094
42
+ d1: 0.3277
43
+ r1: 0.3094
44
+ distinct_2: 0.8368
45
+ repetition_2: 0.0268
46
+ d2: 0.8368
47
+ r2: 0.0268
48
+ distinct_4: 0.9985
49
+ repetition_4: 0.0008
50
+ d4: 0.9985
51
+ r4: 0.0008
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu1.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu2.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.94
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 249)
8
+ Average denoising rounds per sample: 249.00
9
+ First sample preview: ' Altoona — A fifth-year physics student at an evangelical Alto State injured his self in Boulder after receiving death a'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.50760142278298,
21
+ "median_nll": 5.113685607910156,
22
+ "ppl": 246.55902638854954,
23
+ "acc": 0.20347219018621887,
24
+ "tokens": 65031,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 249.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.94
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu2.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu2.json
39
+ Diversity metrics for pps4_lam0.6_temp0.94_gpu2.json:
40
+ distinct_1: 0.3302
41
+ repetition_1: 0.3070
42
+ d1: 0.3302
43
+ r1: 0.3070
44
+ distinct_2: 0.8423
45
+ repetition_2: 0.0257
46
+ d2: 0.8423
47
+ r2: 0.0257
48
+ distinct_4: 0.9991
49
+ repetition_4: 0.0003
50
+ d4: 0.9991
51
+ r4: 0.0003
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu2.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu3.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.94
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 244)
8
+ Average denoising rounds per sample: 244.00
9
+ First sample preview: "Microsoft's impressive Project Halo - as a cyber-punk augmented reality game brings a bit laser arsenal-like, thanks to "
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.539563543188986,
21
+ "median_nll": 5.134376525878906,
22
+ "ppl": 254.56686776493189,
23
+ "acc": 0.19772325205753405,
24
+ "tokens": 65005,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 244.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.94
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu3.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu3.json
39
+ Diversity metrics for pps4_lam0.6_temp0.94_gpu3.json:
40
+ distinct_1: 0.3365
41
+ repetition_1: 0.3043
42
+ d1: 0.3365
43
+ r1: 0.3043
44
+ distinct_2: 0.8469
45
+ repetition_2: 0.0249
46
+ d2: 0.8469
47
+ r2: 0.0249
48
+ distinct_4: 0.9988
49
+ repetition_4: 0.0005
50
+ d4: 0.9988
51
+ r4: 0.0005
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu3.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu4.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.94
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 242)
8
+ Average denoising rounds per sample: 242.00
9
+ First sample preview: '’t think, “that there’s not all,” Give me some man, who proclaims the life and “s the earth like a leaf,””\n\nThe idea of '
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.478549847127144,
21
+ "median_nll": 5.078615188598633,
22
+ "ppl": 239.49914505266958,
23
+ "acc": 0.2047227136374125,
24
+ "tokens": 65005,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 242.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.94
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu4.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu4.json
39
+ Diversity metrics for pps4_lam0.6_temp0.94_gpu4.json:
40
+ distinct_1: 0.3377
41
+ repetition_1: 0.3060
42
+ d1: 0.3377
43
+ r1: 0.3060
44
+ distinct_2: 0.8462
45
+ repetition_2: 0.0236
46
+ d2: 0.8462
47
+ r2: 0.0236
48
+ distinct_4: 0.9990
49
+ repetition_4: 0.0006
50
+ d4: 0.9990
51
+ r4: 0.0006
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu4.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu5.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.94
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 246)
8
+ Average denoising rounds per sample: 246.00
9
+ First sample preview: '\'(Amused" faces : not because of himself vs her) I\'re sure that\'s or anything could relate.\n\n/No, this one.. I mean, I\'m'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.5353770273285425,
21
+ "median_nll": 5.149424076080322,
22
+ "ppl": 253.50334731146614,
23
+ "acc": 0.19396186929693632,
24
+ "tokens": 64987,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 246.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.94
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu5.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu5.json
39
+ Diversity metrics for pps4_lam0.6_temp0.94_gpu5.json:
40
+ distinct_1: 0.3386
41
+ repetition_1: 0.3035
42
+ d1: 0.3386
43
+ r1: 0.3035
44
+ distinct_2: 0.8467
45
+ repetition_2: 0.0230
46
+ d2: 0.8467
47
+ r2: 0.0230
48
+ distinct_4: 0.9992
49
+ repetition_4: 0.0003
50
+ d4: 0.9992
51
+ r4: 0.0003
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu5.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu6.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.94
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 245)
8
+ Average denoising rounds per sample: 245.00
9
+ First sample preview: 'Attitude is probably the simplest and most important venue to establish emotional attachment. I\'m terrified of saying "s'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.497107732198619,
21
+ "median_nll": 5.089093208312988,
22
+ "ppl": 243.9852401313613,
23
+ "acc": 0.19989539909858636,
24
+ "tokens": 65009,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 245.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.94
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu6.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu6.json
39
+ Diversity metrics for pps4_lam0.6_temp0.94_gpu6.json:
40
+ distinct_1: 0.3360
41
+ repetition_1: 0.3111
42
+ d1: 0.3360
43
+ r1: 0.3111
44
+ distinct_2: 0.8476
45
+ repetition_2: 0.0266
46
+ d2: 0.8476
47
+ r2: 0.0266
48
+ distinct_4: 0.9986
49
+ repetition_4: 0.0008
50
+ d4: 0.9986
51
+ r4: 0.0008
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu6.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu7.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.94
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 248)
8
+ Average denoising rounds per sample: 248.00
9
+ First sample preview: '\nThe Happ tech application that officials and and developers at the Department of Safety and Human Services are set to s'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.409098334819644,
21
+ "median_nll": 4.98369288444519,
22
+ "ppl": 223.4300377436419,
23
+ "acc": 0.2115686214213229,
24
+ "tokens": 65038,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 248.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.94
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu7.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu7.json
39
+ Diversity metrics for pps4_lam0.6_temp0.94_gpu7.json:
40
+ distinct_1: 0.3313
41
+ repetition_1: 0.3136
42
+ d1: 0.3313
43
+ r1: 0.3136
44
+ distinct_2: 0.8402
45
+ repetition_2: 0.0263
46
+ d2: 0.8402
47
+ r2: 0.0263
48
+ distinct_4: 0.9987
49
+ repetition_4: 0.0008
50
+ d4: 0.9987
51
+ r4: 0.0008
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu7.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu0.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.96
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 253)
8
+ Average denoising rounds per sample: 253.00
9
+ First sample preview: " new to 'cas' - wasn't Page or Mozilla, or a Newsgram executive course. Nor a pay watch - same thing of that slavery in "
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.746680855705214,
21
+ "median_nll": 5.41691780090332,
22
+ "ppl": 313.14954491001765,
23
+ "acc": 0.18630933161123667,
24
+ "tokens": 65037,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 253.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.96
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu0.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu0.json
39
+ Diversity metrics for pps4_lam0.6_temp0.96_gpu0.json:
40
+ distinct_1: 0.3528
41
+ repetition_1: 0.2864
42
+ d1: 0.3528
43
+ r1: 0.2864
44
+ distinct_2: 0.8623
45
+ repetition_2: 0.0203
46
+ d2: 0.8623
47
+ r2: 0.0203
48
+ distinct_4: 0.9995
49
+ repetition_4: 0.0002
50
+ d4: 0.9995
51
+ r4: 0.0002
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu0.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu1.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.96
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 253)
8
+ Average denoising rounds per sample: 253.00
9
+ First sample preview: ', maybe annos for their own transportation systems more efficient than acceptable. Personally, I believe that, after see'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.8007773466924935,
21
+ "median_nll": 5.507569789886475,
22
+ "ppl": 330.55641700064734,
23
+ "acc": 0.17892665529062707,
24
+ "tokens": 65049,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 253.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.96
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu1.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu1.json
39
+ Diversity metrics for pps4_lam0.6_temp0.96_gpu1.json:
40
+ distinct_1: 0.3488
41
+ repetition_1: 0.2891
42
+ d1: 0.3488
43
+ r1: 0.2891
44
+ distinct_2: 0.8615
45
+ repetition_2: 0.0198
46
+ d2: 0.8615
47
+ r2: 0.0198
48
+ distinct_4: 0.9996
49
+ repetition_4: 0.0001
50
+ d4: 0.9996
51
+ r4: 0.0001
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu1.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu2.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.96
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 251)
8
+ Average denoising rounds per sample: 251.00
9
+ First sample preview: ' a form of scummy self-indulgence at an ego tulips at the self, instead of at other," said Washington political analyst '
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.672595226476284,
21
+ "median_nll": 5.31312894821167,
22
+ "ppl": 290.7882172602754,
23
+ "acc": 0.191125388091359,
24
+ "tokens": 65062,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 251.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.96
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu2.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu2.json
39
+ Diversity metrics for pps4_lam0.6_temp0.96_gpu2.json:
40
+ distinct_1: 0.3354
41
+ repetition_1: 0.2976
42
+ d1: 0.3354
43
+ r1: 0.2976
44
+ distinct_2: 0.8513
45
+ repetition_2: 0.0230
46
+ d2: 0.8513
47
+ r2: 0.0230
48
+ distinct_4: 0.9994
49
+ repetition_4: 0.0002
50
+ d4: 0.9994
51
+ r4: 0.0002
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu2.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu3.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.96
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 254)
8
+ Average denoising rounds per sample: 254.00
9
+ First sample preview: "Microsoft's savage Project Incredible VR is a cyber-punk virtual reality game which functions are psychological arsenal-"
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.729456543464223,
21
+ "median_nll": 5.379550933837891,
22
+ "ppl": 307.801945936048,
23
+ "acc": 0.18857046216291012,
24
+ "tokens": 65042,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 254.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.96
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu3.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu3.json
39
+ Diversity metrics for pps4_lam0.6_temp0.96_gpu3.json:
40
+ distinct_1: 0.3476
41
+ repetition_1: 0.2958
42
+ d1: 0.3476
43
+ r1: 0.2958
44
+ distinct_2: 0.8540
45
+ repetition_2: 0.0243
46
+ d2: 0.8540
47
+ r2: 0.0243
48
+ distinct_4: 0.9989
49
+ repetition_4: 0.0007
50
+ d4: 0.9989
51
+ r4: 0.0007
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu3.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu4.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.96
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 251)
8
+ Average denoising rounds per sample: 251.00
9
+ First sample preview: '’t think, “that there’s not all,” Give me this whole book it proclaims the life and ’s blood of the real monster, NASCAR'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.7241878748270025,
21
+ "median_nll": 5.377181529998779,
22
+ "ppl": 306.18450410108153,
23
+ "acc": 0.18794402583423037,
24
+ "tokens": 65030,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 251.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.96
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu4.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu4.json
39
+ Diversity metrics for pps4_lam0.6_temp0.96_gpu4.json:
40
+ distinct_1: 0.3521
41
+ repetition_1: 0.2910
42
+ d1: 0.3521
43
+ r1: 0.2910
44
+ distinct_2: 0.8587
45
+ repetition_2: 0.0219
46
+ d2: 0.8587
47
+ r2: 0.0219
48
+ distinct_4: 0.9992
49
+ repetition_4: 0.0005
50
+ d4: 0.9992
51
+ r4: 0.0005
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu4.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu5.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.96
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 250)
8
+ Average denoising rounds per sample: 250.00
9
+ First sample preview: "'(AmWarning to work..... not because Tikta is interesting or I're doing that' or anything, narunas thought/No, this one "
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.725282199884571,
21
+ "median_nll": 5.394169807434082,
22
+ "ppl": 306.51975287827094,
23
+ "acc": 0.1891035013466718,
24
+ "tokens": 64975,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 250.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.96
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu5.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu5.json
39
+ Diversity metrics for pps4_lam0.6_temp0.96_gpu5.json:
40
+ distinct_1: 0.3553
41
+ repetition_1: 0.2871
42
+ d1: 0.3553
43
+ r1: 0.2871
44
+ distinct_2: 0.8593
45
+ repetition_2: 0.0212
46
+ d2: 0.8593
47
+ r2: 0.0212
48
+ distinct_4: 0.9991
49
+ repetition_4: 0.0006
50
+ d4: 0.9991
51
+ r4: 0.0006
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu5.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu6.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.96
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 251)
8
+ Average denoising rounds per sample: 251.00
9
+ First sample preview: 'Attendingment inside the panel") is a venue to establish emotional attachment to the things left of you (they\'re now any'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.746712427606919,
21
+ "median_nll": 5.3975830078125,
22
+ "ppl": 313.15943179274166,
23
+ "acc": 0.18455819097947646,
24
+ "tokens": 65096,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 251.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.96
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu6.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu6.json
39
+ Diversity metrics for pps4_lam0.6_temp0.96_gpu6.json:
40
+ distinct_1: 0.3455
41
+ repetition_1: 0.2982
42
+ d1: 0.3455
43
+ r1: 0.2982
44
+ distinct_2: 0.8554
45
+ repetition_2: 0.0226
46
+ d2: 0.8554
47
+ r2: 0.0226
48
+ distinct_4: 0.9989
49
+ repetition_4: 0.0006
50
+ d4: 0.9989
51
+ r4: 0.0006
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu6.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu7.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.96
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 254)
8
+ Average denoising rounds per sample: 254.00
9
+ First sample preview: '\nThe Happ tech application that officials and and developers at the Department of Safety and Human Services are set to s'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.675058493158582,
21
+ "median_nll": 5.313899517059326,
22
+ "ppl": 291.5053891175974,
23
+ "acc": 0.19025290183718963,
24
+ "tokens": 65045,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 254.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.96
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu7.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu7.json
39
+ Diversity metrics for pps4_lam0.6_temp0.96_gpu7.json:
40
+ distinct_1: 0.3437
41
+ repetition_1: 0.2939
42
+ d1: 0.3437
43
+ r1: 0.2939
44
+ distinct_2: 0.8529
45
+ repetition_2: 0.0223
46
+ d2: 0.8529
47
+ r2: 0.0223
48
+ distinct_4: 0.9988
49
+ repetition_4: 0.0006
50
+ d4: 0.9988
51
+ r4: 0.0006
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu7.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu0.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.98
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 258)
8
+ Average denoising rounds per sample: 258.00
9
+ First sample preview: " new to 'cas' - wasn't Page or Mozilla, or a Newsgram search report. Nor a pay watch - same tech of that investigations "
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.965963974092866,
21
+ "median_nll": 5.685207843780518,
22
+ "ppl": 389.92872815117715,
23
+ "acc": 0.1719249692496925,
24
+ "tokens": 65040,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 258.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.98
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu0.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu0.json
39
+ Diversity metrics for pps4_lam0.6_temp0.98_gpu0.json:
40
+ distinct_1: 0.3546
41
+ repetition_1: 0.2820
42
+ d1: 0.3546
43
+ r1: 0.2820
44
+ distinct_2: 0.8656
45
+ repetition_2: 0.0175
46
+ d2: 0.8656
47
+ r2: 0.0175
48
+ distinct_4: 0.9995
49
+ repetition_4: 0.0001
50
+ d4: 0.9995
51
+ r4: 0.0001
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu0.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu1.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.98
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 256)
8
+ Average denoising rounds per sample: 256.00
9
+ First sample preview: ', maybe annos for their own transportation systems more efficient than acceptable. Personally, I believe that, after see'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 6.022894606221046,
21
+ "median_nll": 5.761094093322754,
22
+ "ppl": 412.77167961127736,
23
+ "acc": 0.16454527265171687,
24
+ "tokens": 64973,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 256.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.98
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu1.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu1.json
39
+ Diversity metrics for pps4_lam0.6_temp0.98_gpu1.json:
40
+ distinct_1: 0.3711
41
+ repetition_1: 0.2737
42
+ d1: 0.3711
43
+ r1: 0.2737
44
+ distinct_2: 0.8719
45
+ repetition_2: 0.0174
46
+ d2: 0.8719
47
+ r2: 0.0174
48
+ distinct_4: 0.9994
49
+ repetition_4: 0.0002
50
+ d4: 0.9994
51
+ r4: 0.0002
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu1.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu2.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.98
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 258)
8
+ Average denoising rounds per sample: 258.00
9
+ First sample preview: ' a form of scrawled self-indulgence at an ego tulips onto the self, instead prompts written criticism, said Senate candi'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.992293243009679,
21
+ "median_nll": 5.717593193054199,
22
+ "ppl": 400.331615746006,
23
+ "acc": 0.16747580273467508,
24
+ "tokens": 65090,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 258.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.98
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu2.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu2.json
39
+ Diversity metrics for pps4_lam0.6_temp0.98_gpu2.json:
40
+ distinct_1: 0.3511
41
+ repetition_1: 0.2760
42
+ d1: 0.3511
43
+ r1: 0.2760
44
+ distinct_2: 0.8615
45
+ repetition_2: 0.0172
46
+ d2: 0.8615
47
+ r2: 0.0172
48
+ distinct_4: 0.9994
49
+ repetition_4: 0.0001
50
+ d4: 0.9994
51
+ r4: 0.0001
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu2.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu3.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.98
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 252)
8
+ Average denoising rounds per sample: 252.00
9
+ First sample preview: "Imagine's revolutionary Blocks arcade mode as a cyber-punk augmented reality game which functions from laser arsenal-lik"
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.9575406407160765,
21
+ "median_nll": 5.658609390258789,
22
+ "ppl": 386.65802293967437,
23
+ "acc": 0.1708832531028437,
24
+ "tokens": 65021,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 252.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.98
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu3.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu3.json
39
+ Diversity metrics for pps4_lam0.6_temp0.98_gpu3.json:
40
+ distinct_1: 0.3571
41
+ repetition_1: 0.2828
42
+ d1: 0.3571
43
+ r1: 0.2828
44
+ distinct_2: 0.8640
45
+ repetition_2: 0.0189
46
+ d2: 0.8640
47
+ r2: 0.0189
48
+ distinct_4: 0.9994
49
+ repetition_4: 0.0003
50
+ d4: 0.9994
51
+ r4: 0.0003
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu3.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu4.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.98
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 253)
8
+ Average denoising rounds per sample: 253.00
9
+ First sample preview: '’t think, “that there’s not all,” Give me this whole book it proclaims the life and ’s blood of the real monster, NASCAR'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.985462752583502,
21
+ "median_nll": 5.731670618057251,
22
+ "ppl": 397.6064721063864,
23
+ "acc": 0.171787537676078,
24
+ "tokens": 65028,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 253.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.98
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu4.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu4.json
39
+ Diversity metrics for pps4_lam0.6_temp0.98_gpu4.json:
40
+ distinct_1: 0.3664
41
+ repetition_1: 0.2722
42
+ d1: 0.3664
43
+ r1: 0.2722
44
+ distinct_2: 0.8746
45
+ repetition_2: 0.0163
46
+ d2: 0.8746
47
+ r2: 0.0163
48
+ distinct_4: 0.9997
49
+ repetition_4: 0.0002
50
+ d4: 0.9997
51
+ r4: 0.0002
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu4.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu5.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.98
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 254)
8
+ Average denoising rounds per sample: 254.00
9
+ First sample preview: "'(AmWarning to work..... not because obta is interesting or I're doing that's or anything else narun titles related/No, "
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.945007449058054,
21
+ "median_nll": 5.640978813171387,
22
+ "ppl": 381.84220565183045,
23
+ "acc": 0.17253364090734333,
24
+ "tokens": 65025,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 254.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.98
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu5.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu5.json
39
+ Diversity metrics for pps4_lam0.6_temp0.98_gpu5.json:
40
+ distinct_1: 0.3613
41
+ repetition_1: 0.2780
42
+ d1: 0.3613
43
+ r1: 0.2780
44
+ distinct_2: 0.8714
45
+ repetition_2: 0.0169
46
+ d2: 0.8714
47
+ r2: 0.0169
48
+ distinct_4: 0.9995
49
+ repetition_4: 0.0002
50
+ d4: 0.9995
51
+ r4: 0.0002
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu5.json
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu6.log ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ `torch_dtype` is deprecated! Use `dtype` instead!
2
+ Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
3
+ Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
4
+ level_lambdas = [0.6]
5
+ leaf_temperature = 0.98
6
+ Generating 128 samples (L=512)...
7
+ sampled 128/128 (steps this call: 253)
8
+ Average denoising rounds per sample: 253.00
9
+ First sample preview: ' Dynamo will acquire stadium licenses on camera video for every venue from experience of one.\n\nMembers of Vancouver-base'
10
+ Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
11
+ Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
12
+
13
+ Eval LM loaded (774,030,080 params)
14
+ Scoring samples under eval LM...
15
+ scored 32/128
16
+ scored 64/128
17
+ scored 96/128
18
+ scored 128/128
19
+ {
20
+ "avg_nll": 5.938803984301763,
21
+ "median_nll": 5.663514137268066,
22
+ "ppl": 379.4807930294375,
23
+ "acc": 0.1718584315593736,
24
+ "tokens": 65071,
25
+ "checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
26
+ "eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
27
+ "eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
28
+ "num_samples": 128,
29
+ "generated_seq_len": 512,
30
+ "mode": "sad_generation",
31
+ "model_type": "block",
32
+ "level_lambdas": "0.6",
33
+ "avg_steps": 253.0,
34
+ "positions_per_step": 4,
35
+ "leaf_temperature": 0.98
36
+ }
37
+ Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu6.json
38
+ Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu6.json
39
+ Diversity metrics for pps4_lam0.6_temp0.98_gpu6.json:
40
+ distinct_1: 0.3631
41
+ repetition_1: 0.2781
42
+ d1: 0.3631
43
+ r1: 0.2781
44
+ distinct_2: 0.8696
45
+ repetition_2: 0.0176
46
+ d2: 0.8696
47
+ r2: 0.0176
48
+ distinct_4: 0.9995
49
+ repetition_4: 0.0001
50
+ d4: 0.9995
51
+ r4: 0.0001
52
+ num_samples: 128.0000
53
+ Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu6.json