backfill batch 13 (400)
Browse filesThis view is limited to 50 files because it contains too many changes. See raw diff
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu5.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu6.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu7.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu0.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu1.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu2.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu3.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu4.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu5.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu6.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu7.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu0.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu1.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu2.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu3.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu4.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu5.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu6.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu7.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu0.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu1.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu2.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu3.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu4.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu5.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu6.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu7.log +50 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu0.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu1.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu2.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu3.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu4.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu5.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu6.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu7.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu0.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu1.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu2.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu3.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu4.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu5.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu6.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu7.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu0.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu1.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu2.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu3.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu4.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu5.log +53 -0
- eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu6.log +53 -0
eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu5.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.1
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 128)
|
| 7 |
+
sampled 128/128 (steps this call: 128)
|
| 8 |
+
Average denoising rounds per sample: 128.00
|
| 9 |
+
First sample preview: ' said.\n\n"The the process is going to be there,” Lehman said.\n\nIn the first phase of the new plan, the City Council will '
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 0.6509510393194246,
|
| 25 |
+
"median_nll": 0.03751843422651291,
|
| 26 |
+
"ppl": 1.9173634502150882,
|
| 27 |
+
"acc": 0.8601345708387829,
|
| 28 |
+
"tokens": 63461,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 128.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.1
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.1_gpu5.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.1_gpu5.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.1_gpu5.json:
|
| 43 |
+
distinct_1: 0.0353
|
| 44 |
+
repetition_1: 0.9000
|
| 45 |
+
distinct_2: 0.0966
|
| 46 |
+
repetition_2: 0.8364
|
| 47 |
+
distinct_4: 0.2286
|
| 48 |
+
repetition_4: 0.7112
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.1_gpu5.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu6.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.1
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 128)
|
| 7 |
+
sampled 128/128 (steps this call: 128)
|
| 8 |
+
Average denoising rounds per sample: 128.00
|
| 9 |
+
First sample preview: ' FBI to reopen the case.\n\nBut he said, that is not the case.\n\nThe report said, which was released Tuesday, that the FBI '
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 0.6457859240297437,
|
| 25 |
+
"median_nll": 0.031859297305345535,
|
| 26 |
+
"ppl": 1.9074855790746221,
|
| 27 |
+
"acc": 0.868684457599338,
|
| 28 |
+
"tokens": 62841,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 128.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.1
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.1_gpu6.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.1_gpu6.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.1_gpu6.json:
|
| 43 |
+
distinct_1: 0.0377
|
| 44 |
+
repetition_1: 0.9133
|
| 45 |
+
distinct_2: 0.1010
|
| 46 |
+
repetition_2: 0.8568
|
| 47 |
+
distinct_4: 0.2161
|
| 48 |
+
repetition_4: 0.7502
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.1_gpu6.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.1_gpu7.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.1
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 128)
|
| 7 |
+
sampled 128/128 (steps this call: 128)
|
| 8 |
+
Average denoising rounds per sample: 128.00
|
| 9 |
+
First sample preview: '\n\n\nof the\n\nof the\n\n\n\n\n\n of the\n\nand of the\n\n\n\n\n\n\n\n\n\nof the\n\nof\n\nof\n\n\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof\n\nof the'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 0.6516889086104449,
|
| 25 |
+
"median_nll": 0.0424233041703701,
|
| 26 |
+
"ppl": 1.9187787359084396,
|
| 27 |
+
"acc": 0.8566443038579828,
|
| 28 |
+
"tokens": 62753,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 128.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.1
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.1_gpu7.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.1_gpu7.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.1_gpu7.json:
|
| 43 |
+
distinct_1: 0.0319
|
| 44 |
+
repetition_1: 0.8956
|
| 45 |
+
distinct_2: 0.0932
|
| 46 |
+
repetition_2: 0.8163
|
| 47 |
+
distinct_4: 0.2333
|
| 48 |
+
repetition_4: 0.6856
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.1_gpu7.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu0.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.4
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 131)
|
| 7 |
+
sampled 128/128 (steps this call: 134)
|
| 8 |
+
Average denoising rounds per sample: 132.50
|
| 9 |
+
First sample preview: 'BBR Inc., Inc.BBR, Inc. is.\n\n(USA, Canada, Australia, New York, USA)\n\nThe company BBR Inc. , Inc.\n\nBBR Inc. is.\n\nBBR Inc'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 1.1519089559516735,
|
| 25 |
+
"median_nll": 0.17637917399406433,
|
| 26 |
+
"ppl": 3.1642275189102804,
|
| 27 |
+
"acc": 0.7490172314672384,
|
| 28 |
+
"tokens": 64359,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 132.5,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.4
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu0.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu0.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.4_gpu0.json:
|
| 43 |
+
distinct_1: 0.0671
|
| 44 |
+
repetition_1: 0.8292
|
| 45 |
+
distinct_2: 0.2072
|
| 46 |
+
repetition_2: 0.6862
|
| 47 |
+
distinct_4: 0.4266
|
| 48 |
+
repetition_4: 0.4948
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu0.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu1.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.4
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 131)
|
| 7 |
+
sampled 128/128 (steps this call: 129)
|
| 8 |
+
Average denoising rounds per sample: 130.00
|
| 9 |
+
First sample preview: 'Dear friends,\n\n\nsum’ to been a great year to us, the Reddit community, and the the community of Reddit it.\n\nWe’ve had a '
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 1.1469716861952688,
|
| 25 |
+
"median_nll": 0.14914770424365997,
|
| 26 |
+
"ppl": 3.1486433772917226,
|
| 27 |
+
"acc": 0.7549979663986485,
|
| 28 |
+
"tokens": 63926,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 130.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.4
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu1.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu1.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.4_gpu1.json:
|
| 43 |
+
distinct_1: 0.0805
|
| 44 |
+
repetition_1: 0.7894
|
| 45 |
+
distinct_2: 0.2360
|
| 46 |
+
repetition_2: 0.6363
|
| 47 |
+
distinct_4: 0.4586
|
| 48 |
+
repetition_4: 0.4540
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu1.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu2.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.4
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 136)
|
| 7 |
+
sampled 128/128 (steps this call: 132)
|
| 8 |
+
Average denoising rounds per sample: 134.00
|
| 9 |
+
First sample preview: ' the some of the tutorial on how to make the the..\n\nThe design of a the. is not the same as the design of a the. .\n\nThe '
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 1.147666217670304,
|
| 25 |
+
"median_nll": 0.1741468757390976,
|
| 26 |
+
"ppl": 3.1508309688085583,
|
| 27 |
+
"acc": 0.7498316340114959,
|
| 28 |
+
"tokens": 63849,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 134.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.4
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu2.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu2.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.4_gpu2.json:
|
| 43 |
+
distinct_1: 0.0745
|
| 44 |
+
repetition_1: 0.8154
|
| 45 |
+
distinct_2: 0.2242
|
| 46 |
+
repetition_2: 0.6672
|
| 47 |
+
distinct_4: 0.4587
|
| 48 |
+
repetition_4: 0.4786
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu2.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu3.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.4
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 133)
|
| 7 |
+
sampled 128/128 (steps this call: 132)
|
| 8 |
+
Average denoising rounds per sample: 132.50
|
| 9 |
+
First sample preview: 'U.S.S. is the best in the world, but not at the best of the world, to say according to the BBC. In a report released Tue'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 1.14529267073261,
|
| 25 |
+
"median_nll": 0.17469988763332367,
|
| 26 |
+
"ppl": 3.1433611920511138,
|
| 27 |
+
"acc": 0.7467620517136578,
|
| 28 |
+
"tokens": 64161,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 132.5,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.4
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu3.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu3.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.4_gpu3.json:
|
| 43 |
+
distinct_1: 0.0750
|
| 44 |
+
repetition_1: 0.8150
|
| 45 |
+
distinct_2: 0.2269
|
| 46 |
+
repetition_2: 0.6603
|
| 47 |
+
distinct_4: 0.4797
|
| 48 |
+
repetition_4: 0.4461
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu3.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu4.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.4
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 133)
|
| 7 |
+
sampled 128/128 (steps this call: 132)
|
| 8 |
+
Average denoising rounds per sample: 132.50
|
| 9 |
+
First sample preview: '\n.\n\n,\n\n\n.\n\n.\n\n.\n\n\n.\n\n\n.\n\n.\n\n.\n\n\n.\n\n\n.\n\n.\n\n\n.\n\n.\n\n.\n\n.\n\n.\n\n\n\n.\n\n.\n\n.\n\n.\n\n. .\n\n.\n\n.\n\n.\n\n. .\n\n.\n\n.\n\n.\n\n.\n\n. .\n\n.\n\n.\n\n\n.\n\n.\n'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 1.0779396125068843,
|
| 25 |
+
"median_nll": 0.14342989027500153,
|
| 26 |
+
"ppl": 2.938618616228597,
|
| 27 |
+
"acc": 0.7666852834403798,
|
| 28 |
+
"tokens": 64458,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 132.5,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.4
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu4.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu4.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.4_gpu4.json:
|
| 43 |
+
distinct_1: 0.0702
|
| 44 |
+
repetition_1: 0.8305
|
| 45 |
+
distinct_2: 0.2145
|
| 46 |
+
repetition_2: 0.6865
|
| 47 |
+
distinct_4: 0.4504
|
| 48 |
+
repetition_4: 0.4812
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu4.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu5.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.4
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 133)
|
| 7 |
+
sampled 128/128 (steps this call: 133)
|
| 8 |
+
Average denoising rounds per sample: 133.00
|
| 9 |
+
First sample preview: ' said.\n\n"The.C.R. is out of the game," he said.\n\nBut a company close to the company said the company is committed to wor'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 1.1531354440872796,
|
| 25 |
+
"median_nll": 0.16500601172447205,
|
| 26 |
+
"ppl": 3.16811078732511,
|
| 27 |
+
"acc": 0.7510950384237681,
|
| 28 |
+
"tokens": 64153,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 133.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.4
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu5.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu5.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.4_gpu5.json:
|
| 43 |
+
distinct_1: 0.0797
|
| 44 |
+
repetition_1: 0.8124
|
| 45 |
+
distinct_2: 0.2423
|
| 46 |
+
repetition_2: 0.6581
|
| 47 |
+
distinct_4: 0.4821
|
| 48 |
+
repetition_4: 0.4636
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu5.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu6.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.4
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 130)
|
| 7 |
+
sampled 128/128 (steps this call: 131)
|
| 8 |
+
Average denoising rounds per sample: 130.50
|
| 9 |
+
First sample preview: ' was released for the North version of the game last year, following the release of Wii U.\n\nThere is a new version, howe'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 1.1192875892864118,
|
| 25 |
+
"median_nll": 0.16515083611011505,
|
| 26 |
+
"ppl": 3.062671545889563,
|
| 27 |
+
"acc": 0.7531603043892683,
|
| 28 |
+
"tokens": 63997,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 130.5,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.4
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu6.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu6.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.4_gpu6.json:
|
| 43 |
+
distinct_1: 0.0701
|
| 44 |
+
repetition_1: 0.8150
|
| 45 |
+
distinct_2: 0.2151
|
| 46 |
+
repetition_2: 0.6697
|
| 47 |
+
distinct_4: 0.4521
|
| 48 |
+
repetition_4: 0.4745
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu6.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.4_gpu7.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.4
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 132)
|
| 7 |
+
sampled 128/128 (steps this call: 132)
|
| 8 |
+
Average denoising rounds per sample: 132.00
|
| 9 |
+
First sample preview: ',” in the decision to appeal the decision.\n\nThe court gave the aisies the two days to make the decision on the case, the'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 1.1630522965856211,
|
| 25 |
+
"median_nll": 0.20357447117567062,
|
| 26 |
+
"ppl": 3.1996847732230664,
|
| 27 |
+
"acc": 0.7394515756269715,
|
| 28 |
+
"tokens": 64038,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 132.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.4
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.4_gpu7.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.4_gpu7.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.4_gpu7.json:
|
| 43 |
+
distinct_1: 0.0792
|
| 44 |
+
repetition_1: 0.7923
|
| 45 |
+
distinct_2: 0.2420
|
| 46 |
+
repetition_2: 0.6238
|
| 47 |
+
distinct_4: 0.4965
|
| 48 |
+
repetition_4: 0.4170
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.4_gpu7.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu0.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.7
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 180)
|
| 7 |
+
sampled 128/128 (steps this call: 183)
|
| 8 |
+
Average denoising rounds per sample: 181.50
|
| 9 |
+
First sample preview: ' and I’ve seen the victims of and the victims murdered in the Los Angeles area.” So what else…\n\nThe next day we responde'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 2.942398785483946,
|
| 25 |
+
"median_nll": 2.017829656600952,
|
| 26 |
+
"ppl": 18.961275835862214,
|
| 27 |
+
"acc": 0.44926435249065905,
|
| 28 |
+
"tokens": 64501,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 181.5,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.7
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu0.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu0.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.7_gpu0.json:
|
| 43 |
+
distinct_1: 0.1963
|
| 44 |
+
repetition_1: 0.5336
|
| 45 |
+
distinct_2: 0.6266
|
| 46 |
+
repetition_2: 0.2041
|
| 47 |
+
distinct_4: 0.9265
|
| 48 |
+
repetition_4: 0.0655
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu0.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu1.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.7
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 183)
|
| 7 |
+
sampled 128/128 (steps this call: 174)
|
| 8 |
+
Average denoising rounds per sample: 178.50
|
| 9 |
+
First sample preview: 'Google Flipboard\n\nTwitter\n\nGoogle\n\n\nLinkedIn\n\nReddit Plus\n\ngoogle\n\n\n\nFacebook\n\n\n\nEmail\n\nGuest Note:\n\nThanks, Laura Lee, '
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 2.9454587164628476,
|
| 25 |
+
"median_nll": 2.053232431411743,
|
| 26 |
+
"ppl": 19.01938489069995,
|
| 27 |
+
"acc": 0.44612356241668993,
|
| 28 |
+
"tokens": 64518,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 178.5,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.7
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu1.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu1.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.7_gpu1.json:
|
| 43 |
+
distinct_1: 0.1902
|
| 44 |
+
repetition_1: 0.5426
|
| 45 |
+
distinct_2: 0.6052
|
| 46 |
+
repetition_2: 0.2125
|
| 47 |
+
distinct_4: 0.9222
|
| 48 |
+
repetition_4: 0.0645
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu1.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu2.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.7
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 175)
|
| 7 |
+
sampled 128/128 (steps this call: 170)
|
| 8 |
+
Average denoising rounds per sample: 172.50
|
| 9 |
+
First sample preview: ' the trip to the USA by the NNVE backing group to create it. The story was the template for NNVE.\n\nAnd the mysterious be'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 2.7603239347687127,
|
| 25 |
+
"median_nll": 1.7485754489898682,
|
| 26 |
+
"ppl": 15.804961895789319,
|
| 27 |
+
"acc": 0.48433919022154315,
|
| 28 |
+
"tokens": 64141,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 172.5,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.7
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu2.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu2.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.7_gpu2.json:
|
| 43 |
+
distinct_1: 0.1953
|
| 44 |
+
repetition_1: 0.5519
|
| 45 |
+
distinct_2: 0.6067
|
| 46 |
+
repetition_2: 0.2377
|
| 47 |
+
distinct_4: 0.9070
|
| 48 |
+
repetition_4: 0.0826
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu2.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu3.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.7
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 173)
|
| 7 |
+
sampled 128/128 (steps this call: 175)
|
| 8 |
+
Average denoising rounds per sample: 174.00
|
| 9 |
+
First sample preview: 'If you are staying in hotel on Monday in UAMA, you have until at least 10:13 am Sunday on March 18 to get there. If a pl'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 2.8654510964581106,
|
| 25 |
+
"median_nll": 1.9266316890716553,
|
| 26 |
+
"ppl": 17.55697130610988,
|
| 27 |
+
"acc": 0.46492573145609717,
|
| 28 |
+
"tokens": 64563,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 174.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.7
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu3.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu3.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.7_gpu3.json:
|
| 43 |
+
distinct_1: 0.1934
|
| 44 |
+
repetition_1: 0.5501
|
| 45 |
+
distinct_2: 0.6095
|
| 46 |
+
repetition_2: 0.2326
|
| 47 |
+
distinct_4: 0.9177
|
| 48 |
+
repetition_4: 0.0795
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu3.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu4.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.7
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 186)
|
| 7 |
+
sampled 128/128 (steps this call: 177)
|
| 8 |
+
Average denoising rounds per sample: 181.50
|
| 9 |
+
First sample preview: ' and, the electrician wanted to keep his eyes on the a Tesla. For a moment, if he was ever the same side with his driver'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 2.929448415530568,
|
| 25 |
+
"median_nll": 2.029412031173706,
|
| 26 |
+
"ppl": 18.717303474915926,
|
| 27 |
+
"acc": 0.44909500504932803,
|
| 28 |
+
"tokens": 64365,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 181.5,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.7
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu4.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu4.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.7_gpu4.json:
|
| 43 |
+
distinct_1: 0.2037
|
| 44 |
+
repetition_1: 0.5318
|
| 45 |
+
distinct_2: 0.6382
|
| 46 |
+
repetition_2: 0.2019
|
| 47 |
+
distinct_4: 0.9355
|
| 48 |
+
repetition_4: 0.0559
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu4.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu5.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.7
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 174)
|
| 7 |
+
sampled 128/128 (steps this call: 176)
|
| 8 |
+
Average denoising rounds per sample: 175.00
|
| 9 |
+
First sample preview: 'Dell Vogts and Schmitz flew a three-year-old space shuttle, in orbit, but the company—fueled up to the and now active on'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 2.893385421106573,
|
| 25 |
+
"median_nll": 1.985037088394165,
|
| 26 |
+
"ppl": 18.05432775945453,
|
| 27 |
+
"acc": 0.45797362017390225,
|
| 28 |
+
"tokens": 64519,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 175.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.7
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu5.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu5.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.7_gpu5.json:
|
| 43 |
+
distinct_1: 0.1917
|
| 44 |
+
repetition_1: 0.5309
|
| 45 |
+
distinct_2: 0.6122
|
| 46 |
+
repetition_2: 0.2127
|
| 47 |
+
distinct_4: 0.9240
|
| 48 |
+
repetition_4: 0.0702
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu5.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu6.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.7
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 174)
|
| 7 |
+
sampled 128/128 (steps this call: 180)
|
| 8 |
+
Average denoising rounds per sample: 177.00
|
| 9 |
+
First sample preview: '.”\n\nagainst\n\nthe hand, though, a bayonet is used to throw a punch. I had a claw handle and was\nduc using it,\n\nand he swu'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 2.8696047275553243,
|
| 25 |
+
"median_nll": 1.9438047409057617,
|
| 26 |
+
"ppl": 17.630048150161716,
|
| 27 |
+
"acc": 0.4609834731438588,
|
| 28 |
+
"tokens": 63896,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 177.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.7
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu6.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu6.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.7_gpu6.json:
|
| 43 |
+
distinct_1: 0.1961
|
| 44 |
+
repetition_1: 0.5396
|
| 45 |
+
distinct_2: 0.6178
|
| 46 |
+
repetition_2: 0.2154
|
| 47 |
+
distinct_4: 0.9188
|
| 48 |
+
repetition_4: 0.0717
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu6.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.7_gpu7.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.7
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 179)
|
| 7 |
+
sampled 128/128 (steps this call: 177)
|
| 8 |
+
Average denoising rounds per sample: 178.00
|
| 9 |
+
First sample preview: '“Not always in the past,” said Evron Morales.\n\nA quote from two-quite-assed-people was long ago an unspoken part of the '
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 2.9287707690608333,
|
| 25 |
+
"median_nll": 2.006821036338806,
|
| 26 |
+
"ppl": 18.704624056859846,
|
| 27 |
+
"acc": 0.4540028525362768,
|
| 28 |
+
"tokens": 64504,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 178.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.7
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.7_gpu7.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.7_gpu7.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.7_gpu7.json:
|
| 43 |
+
distinct_1: 0.1917
|
| 44 |
+
repetition_1: 0.5379
|
| 45 |
+
distinct_2: 0.6068
|
| 46 |
+
repetition_2: 0.2181
|
| 47 |
+
distinct_4: 0.9081
|
| 48 |
+
repetition_4: 0.0819
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.7_gpu7.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu0.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.8
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 210)
|
| 7 |
+
sampled 128/128 (steps this call: 201)
|
| 8 |
+
Average denoising rounds per sample: 205.50
|
| 9 |
+
First sample preview: ' and I’ve had three victims dead four more victims murdered in the Los Angeles area.” So what else might there go on Ear'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 3.9368979006805738,
|
| 25 |
+
"median_nll": 3.2145655155181885,
|
| 26 |
+
"ppl": 51.25934283792319,
|
| 27 |
+
"acc": 0.32915863345415286,
|
| 28 |
+
"tokens": 64835,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 205.5,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.8
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu0.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu0.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.8_gpu0.json:
|
| 43 |
+
distinct_1: 0.2465
|
| 44 |
+
repetition_1: 0.4214
|
| 45 |
+
distinct_2: 0.7338
|
| 46 |
+
repetition_2: 0.0834
|
| 47 |
+
distinct_4: 0.9898
|
| 48 |
+
repetition_4: 0.0081
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu0.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu1.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.8
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 206)
|
| 7 |
+
sampled 128/128 (steps this call: 204)
|
| 8 |
+
Average denoising rounds per sample: 205.00
|
| 9 |
+
First sample preview: 'Twenty-terrorist were killed during the clashes- the operation in Messed where eight ISIS sympathisers were being detain'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 3.9516018208961854,
|
| 25 |
+
"median_nll": 3.2193745374679565,
|
| 26 |
+
"ppl": 52.018624654934406,
|
| 27 |
+
"acc": 0.3302834533708386,
|
| 28 |
+
"tokens": 64702,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 205.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.8
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu1.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu1.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.8_gpu1.json:
|
| 43 |
+
distinct_1: 0.2552
|
| 44 |
+
repetition_1: 0.4202
|
| 45 |
+
distinct_2: 0.7408
|
| 46 |
+
repetition_2: 0.0838
|
| 47 |
+
distinct_4: 0.9866
|
| 48 |
+
repetition_4: 0.0113
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu1.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu2.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.8
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 209)
|
| 7 |
+
sampled 128/128 (steps this call: 208)
|
| 8 |
+
Average denoising rounds per sample: 208.50
|
| 9 |
+
First sample preview: 'Im a big fan of this (BEVE specifically) myself.\n\nBELL is an engine for 3D 8 (No obvious). I used Spiv 2 models (I are 1'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 3.9009848416018436,
|
| 25 |
+
"median_nll": 3.143462657928467,
|
| 26 |
+
"ppl": 49.45112665854749,
|
| 27 |
+
"acc": 0.3373799545335045,
|
| 28 |
+
"tokens": 64663,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 208.5,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.8
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu2.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu2.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.8_gpu2.json:
|
| 43 |
+
distinct_1: 0.2504
|
| 44 |
+
repetition_1: 0.4222
|
| 45 |
+
distinct_2: 0.7364
|
| 46 |
+
repetition_2: 0.0895
|
| 47 |
+
distinct_4: 0.9813
|
| 48 |
+
repetition_4: 0.0165
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu2.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu3.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.8
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 204)
|
| 7 |
+
sampled 128/128 (steps this call: 200)
|
| 8 |
+
Average denoising rounds per sample: 202.00
|
| 9 |
+
First sample preview: '\nHave he been attending Cancer Research on Aging (CAMA) in Chicago?\n\nIn the past week, though, he publicly revealed a fa'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 3.9212626953577887,
|
| 25 |
+
"median_nll": 3.1701507568359375,
|
| 26 |
+
"ppl": 50.464125381857606,
|
| 27 |
+
"acc": 0.334229930900153,
|
| 28 |
+
"tokens": 64689,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 202.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.8
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu3.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu3.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.8_gpu3.json:
|
| 43 |
+
distinct_1: 0.2498
|
| 44 |
+
repetition_1: 0.4203
|
| 45 |
+
distinct_2: 0.7356
|
| 46 |
+
repetition_2: 0.0824
|
| 47 |
+
distinct_4: 0.9892
|
| 48 |
+
repetition_4: 0.0084
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu3.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu4.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.8
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 206)
|
| 7 |
+
sampled 128/128 (steps this call: 204)
|
| 8 |
+
Average denoising rounds per sample: 205.00
|
| 9 |
+
First sample preview: ' and-turned electrician Mark Anderson narrowly opened fire on the a Mercedes that came out of a home at 275 in a downtow'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 3.9627575752168345,
|
| 25 |
+
"median_nll": 3.2250115871429443,
|
| 26 |
+
"ppl": 52.60218060308741,
|
| 27 |
+
"acc": 0.3245725044755849,
|
| 28 |
+
"tokens": 64796,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 205.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.8
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu4.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu4.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.8_gpu4.json:
|
| 43 |
+
distinct_1: 0.2448
|
| 44 |
+
repetition_1: 0.4107
|
| 45 |
+
distinct_2: 0.7334
|
| 46 |
+
repetition_2: 0.0736
|
| 47 |
+
distinct_4: 0.9900
|
| 48 |
+
repetition_4: 0.0071
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu4.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu5.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.8
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 200)
|
| 7 |
+
sampled 128/128 (steps this call: 202)
|
| 8 |
+
Average denoising rounds per sample: 201.00
|
| 9 |
+
First sample preview: 'ine W. Barker. While India’s aversion to Corydon is understandable, 1769 it parallels British resistance to Japanese, he'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 3.997569114385298,
|
| 25 |
+
"median_nll": 3.2696503400802612,
|
| 26 |
+
"ppl": 54.46558936083237,
|
| 27 |
+
"acc": 0.32421404061949366,
|
| 28 |
+
"tokens": 64698,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 201.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.8
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu5.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu5.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.8_gpu5.json:
|
| 43 |
+
distinct_1: 0.2539
|
| 44 |
+
repetition_1: 0.4116
|
| 45 |
+
distinct_2: 0.7402
|
| 46 |
+
repetition_2: 0.0813
|
| 47 |
+
distinct_4: 0.9861
|
| 48 |
+
repetition_4: 0.0116
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu5.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu6.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.8
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 202)
|
| 7 |
+
sampled 128/128 (steps this call: 203)
|
| 8 |
+
Average denoising rounds per sample: 202.50
|
| 9 |
+
First sample preview: '\n“z okept e” noise, though a .” I used the “it. I had just unmasked the Hearst happened on him, which it was just “i….i\n'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 3.9174913685951633,
|
| 25 |
+
"median_nll": 3.1576714515686035,
|
| 26 |
+
"ppl": 50.27416709777929,
|
| 27 |
+
"acc": 0.33555683105037,
|
| 28 |
+
"tokens": 64463,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 202.5,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.8
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu6.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu6.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.8_gpu6.json:
|
| 43 |
+
distinct_1: 0.2538
|
| 44 |
+
repetition_1: 0.4267
|
| 45 |
+
distinct_2: 0.7349
|
| 46 |
+
repetition_2: 0.0926
|
| 47 |
+
distinct_4: 0.9816
|
| 48 |
+
repetition_4: 0.0145
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu6.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.8_gpu7.log
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Loaded SAD checkpoint: outputs/sad_block_ar/latest.pt (step=500000)
|
| 3 |
+
level_lambdas = [0.6]
|
| 4 |
+
leaf_temperature = 0.8
|
| 5 |
+
Generating 128 samples (L=512)...
|
| 6 |
+
sampled 64/128 (steps this call: 206)
|
| 7 |
+
sampled 128/128 (steps this call: 198)
|
| 8 |
+
Average denoising rounds per sample: 202.00
|
| 9 |
+
First sample preview: ' with reports from Politico and elsewhere. First, the New York Post reported that:\n\n\nReporting from Washington at the-ba'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 16/128
|
| 16 |
+
scored 32/128
|
| 17 |
+
scored 48/128
|
| 18 |
+
scored 64/128
|
| 19 |
+
scored 80/128
|
| 20 |
+
scored 96/128
|
| 21 |
+
scored 112/128
|
| 22 |
+
scored 128/128
|
| 23 |
+
{
|
| 24 |
+
"avg_nll": 3.962866495961764,
|
| 25 |
+
"median_nll": 3.223786234855652,
|
| 26 |
+
"ppl": 52.60791038382395,
|
| 27 |
+
"acc": 0.3319229106183211,
|
| 28 |
+
"tokens": 64756,
|
| 29 |
+
"checkpoint": "outputs/sad_block_ar/latest.pt",
|
| 30 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 31 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 32 |
+
"num_samples": 128,
|
| 33 |
+
"generated_seq_len": 512,
|
| 34 |
+
"mode": "sad_generation",
|
| 35 |
+
"level_lambdas": "0.6",
|
| 36 |
+
"avg_steps": 202.0,
|
| 37 |
+
"positions_per_step": 4,
|
| 38 |
+
"leaf_temperature": 0.8
|
| 39 |
+
}
|
| 40 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/metrics/pps4_lam0.6_temp0.8_gpu7.json
|
| 41 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/block_ar_gen_ppl/samples/pps4_lam0.6_temp0.8_gpu7.json
|
| 42 |
+
Diversity metrics for pps4_lam0.6_temp0.8_gpu7.json:
|
| 43 |
+
distinct_1: 0.2596
|
| 44 |
+
repetition_1: 0.4171
|
| 45 |
+
distinct_2: 0.7469
|
| 46 |
+
repetition_2: 0.0821
|
| 47 |
+
distinct_4: 0.9917
|
| 48 |
+
repetition_4: 0.0060
|
| 49 |
+
num_samples: 128.0000
|
| 50 |
+
Saved -> eval/block_ar_gen_ppl/diversity/pps4_lam0.6_temp0.8_gpu7.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu0.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.94
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 249)
|
| 8 |
+
Average denoising rounds per sample: 249.00
|
| 9 |
+
First sample preview: " back to the point that we can't Page or verify, but a core said or aired. Nor did the would need to guard that the judg"
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.543587042971091,
|
| 21 |
+
"median_nll": 5.149930000305176,
|
| 22 |
+
"ppl": 255.59318080251396,
|
| 23 |
+
"acc": 0.19897951342462386,
|
| 24 |
+
"tokens": 65067,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 249.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.94
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu0.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu0.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.94_gpu0.json:
|
| 40 |
+
distinct_1: 0.3373
|
| 41 |
+
repetition_1: 0.3051
|
| 42 |
+
d1: 0.3373
|
| 43 |
+
r1: 0.3051
|
| 44 |
+
distinct_2: 0.8485
|
| 45 |
+
repetition_2: 0.0237
|
| 46 |
+
d2: 0.8485
|
| 47 |
+
r2: 0.0237
|
| 48 |
+
distinct_4: 0.9989
|
| 49 |
+
repetition_4: 0.0006
|
| 50 |
+
d4: 0.9989
|
| 51 |
+
r4: 0.0006
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu0.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu1.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.94
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 248)
|
| 8 |
+
Average denoising rounds per sample: 248.00
|
| 9 |
+
First sample preview: ', maybe a positive for their own transportation systems more efficient or acceptable. Personally, I believe that, after '
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.533697939093593,
|
| 21 |
+
"median_nll": 5.119769811630249,
|
| 22 |
+
"ppl": 253.07804997927,
|
| 23 |
+
"acc": 0.20001230277119922,
|
| 24 |
+
"tokens": 65026,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 248.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.94
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu1.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu1.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.94_gpu1.json:
|
| 40 |
+
distinct_1: 0.3277
|
| 41 |
+
repetition_1: 0.3094
|
| 42 |
+
d1: 0.3277
|
| 43 |
+
r1: 0.3094
|
| 44 |
+
distinct_2: 0.8368
|
| 45 |
+
repetition_2: 0.0268
|
| 46 |
+
d2: 0.8368
|
| 47 |
+
r2: 0.0268
|
| 48 |
+
distinct_4: 0.9985
|
| 49 |
+
repetition_4: 0.0008
|
| 50 |
+
d4: 0.9985
|
| 51 |
+
r4: 0.0008
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu1.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu2.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.94
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 249)
|
| 8 |
+
Average denoising rounds per sample: 249.00
|
| 9 |
+
First sample preview: ' Altoona — A fifth-year physics student at an evangelical Alto State injured his self in Boulder after receiving death a'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.50760142278298,
|
| 21 |
+
"median_nll": 5.113685607910156,
|
| 22 |
+
"ppl": 246.55902638854954,
|
| 23 |
+
"acc": 0.20347219018621887,
|
| 24 |
+
"tokens": 65031,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 249.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.94
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu2.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu2.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.94_gpu2.json:
|
| 40 |
+
distinct_1: 0.3302
|
| 41 |
+
repetition_1: 0.3070
|
| 42 |
+
d1: 0.3302
|
| 43 |
+
r1: 0.3070
|
| 44 |
+
distinct_2: 0.8423
|
| 45 |
+
repetition_2: 0.0257
|
| 46 |
+
d2: 0.8423
|
| 47 |
+
r2: 0.0257
|
| 48 |
+
distinct_4: 0.9991
|
| 49 |
+
repetition_4: 0.0003
|
| 50 |
+
d4: 0.9991
|
| 51 |
+
r4: 0.0003
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu2.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu3.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.94
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 244)
|
| 8 |
+
Average denoising rounds per sample: 244.00
|
| 9 |
+
First sample preview: "Microsoft's impressive Project Halo - as a cyber-punk augmented reality game brings a bit laser arsenal-like, thanks to "
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.539563543188986,
|
| 21 |
+
"median_nll": 5.134376525878906,
|
| 22 |
+
"ppl": 254.56686776493189,
|
| 23 |
+
"acc": 0.19772325205753405,
|
| 24 |
+
"tokens": 65005,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 244.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.94
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu3.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu3.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.94_gpu3.json:
|
| 40 |
+
distinct_1: 0.3365
|
| 41 |
+
repetition_1: 0.3043
|
| 42 |
+
d1: 0.3365
|
| 43 |
+
r1: 0.3043
|
| 44 |
+
distinct_2: 0.8469
|
| 45 |
+
repetition_2: 0.0249
|
| 46 |
+
d2: 0.8469
|
| 47 |
+
r2: 0.0249
|
| 48 |
+
distinct_4: 0.9988
|
| 49 |
+
repetition_4: 0.0005
|
| 50 |
+
d4: 0.9988
|
| 51 |
+
r4: 0.0005
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu3.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu4.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.94
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 242)
|
| 8 |
+
Average denoising rounds per sample: 242.00
|
| 9 |
+
First sample preview: '’t think, “that there’s not all,” Give me some man, who proclaims the life and “s the earth like a leaf,””\n\nThe idea of '
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.478549847127144,
|
| 21 |
+
"median_nll": 5.078615188598633,
|
| 22 |
+
"ppl": 239.49914505266958,
|
| 23 |
+
"acc": 0.2047227136374125,
|
| 24 |
+
"tokens": 65005,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 242.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.94
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu4.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu4.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.94_gpu4.json:
|
| 40 |
+
distinct_1: 0.3377
|
| 41 |
+
repetition_1: 0.3060
|
| 42 |
+
d1: 0.3377
|
| 43 |
+
r1: 0.3060
|
| 44 |
+
distinct_2: 0.8462
|
| 45 |
+
repetition_2: 0.0236
|
| 46 |
+
d2: 0.8462
|
| 47 |
+
r2: 0.0236
|
| 48 |
+
distinct_4: 0.9990
|
| 49 |
+
repetition_4: 0.0006
|
| 50 |
+
d4: 0.9990
|
| 51 |
+
r4: 0.0006
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu4.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu5.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.94
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 246)
|
| 8 |
+
Average denoising rounds per sample: 246.00
|
| 9 |
+
First sample preview: '\'(Amused" faces : not because of himself vs her) I\'re sure that\'s or anything could relate.\n\n/No, this one.. I mean, I\'m'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.5353770273285425,
|
| 21 |
+
"median_nll": 5.149424076080322,
|
| 22 |
+
"ppl": 253.50334731146614,
|
| 23 |
+
"acc": 0.19396186929693632,
|
| 24 |
+
"tokens": 64987,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 246.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.94
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu5.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu5.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.94_gpu5.json:
|
| 40 |
+
distinct_1: 0.3386
|
| 41 |
+
repetition_1: 0.3035
|
| 42 |
+
d1: 0.3386
|
| 43 |
+
r1: 0.3035
|
| 44 |
+
distinct_2: 0.8467
|
| 45 |
+
repetition_2: 0.0230
|
| 46 |
+
d2: 0.8467
|
| 47 |
+
r2: 0.0230
|
| 48 |
+
distinct_4: 0.9992
|
| 49 |
+
repetition_4: 0.0003
|
| 50 |
+
d4: 0.9992
|
| 51 |
+
r4: 0.0003
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu5.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu6.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.94
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 245)
|
| 8 |
+
Average denoising rounds per sample: 245.00
|
| 9 |
+
First sample preview: 'Attitude is probably the simplest and most important venue to establish emotional attachment. I\'m terrified of saying "s'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.497107732198619,
|
| 21 |
+
"median_nll": 5.089093208312988,
|
| 22 |
+
"ppl": 243.9852401313613,
|
| 23 |
+
"acc": 0.19989539909858636,
|
| 24 |
+
"tokens": 65009,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 245.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.94
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu6.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu6.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.94_gpu6.json:
|
| 40 |
+
distinct_1: 0.3360
|
| 41 |
+
repetition_1: 0.3111
|
| 42 |
+
d1: 0.3360
|
| 43 |
+
r1: 0.3111
|
| 44 |
+
distinct_2: 0.8476
|
| 45 |
+
repetition_2: 0.0266
|
| 46 |
+
d2: 0.8476
|
| 47 |
+
r2: 0.0266
|
| 48 |
+
distinct_4: 0.9986
|
| 49 |
+
repetition_4: 0.0008
|
| 50 |
+
d4: 0.9986
|
| 51 |
+
r4: 0.0008
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu6.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.94_gpu7.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.94
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 248)
|
| 8 |
+
Average denoising rounds per sample: 248.00
|
| 9 |
+
First sample preview: '\nThe Happ tech application that officials and and developers at the Department of Safety and Human Services are set to s'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.409098334819644,
|
| 21 |
+
"median_nll": 4.98369288444519,
|
| 22 |
+
"ppl": 223.4300377436419,
|
| 23 |
+
"acc": 0.2115686214213229,
|
| 24 |
+
"tokens": 65038,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 248.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.94
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.94_gpu7.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.94_gpu7.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.94_gpu7.json:
|
| 40 |
+
distinct_1: 0.3313
|
| 41 |
+
repetition_1: 0.3136
|
| 42 |
+
d1: 0.3313
|
| 43 |
+
r1: 0.3136
|
| 44 |
+
distinct_2: 0.8402
|
| 45 |
+
repetition_2: 0.0263
|
| 46 |
+
d2: 0.8402
|
| 47 |
+
r2: 0.0263
|
| 48 |
+
distinct_4: 0.9987
|
| 49 |
+
repetition_4: 0.0008
|
| 50 |
+
d4: 0.9987
|
| 51 |
+
r4: 0.0008
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.94_gpu7.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu0.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.96
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 253)
|
| 8 |
+
Average denoising rounds per sample: 253.00
|
| 9 |
+
First sample preview: " new to 'cas' - wasn't Page or Mozilla, or a Newsgram executive course. Nor a pay watch - same thing of that slavery in "
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.746680855705214,
|
| 21 |
+
"median_nll": 5.41691780090332,
|
| 22 |
+
"ppl": 313.14954491001765,
|
| 23 |
+
"acc": 0.18630933161123667,
|
| 24 |
+
"tokens": 65037,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 253.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.96
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu0.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu0.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.96_gpu0.json:
|
| 40 |
+
distinct_1: 0.3528
|
| 41 |
+
repetition_1: 0.2864
|
| 42 |
+
d1: 0.3528
|
| 43 |
+
r1: 0.2864
|
| 44 |
+
distinct_2: 0.8623
|
| 45 |
+
repetition_2: 0.0203
|
| 46 |
+
d2: 0.8623
|
| 47 |
+
r2: 0.0203
|
| 48 |
+
distinct_4: 0.9995
|
| 49 |
+
repetition_4: 0.0002
|
| 50 |
+
d4: 0.9995
|
| 51 |
+
r4: 0.0002
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu0.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu1.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.96
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 253)
|
| 8 |
+
Average denoising rounds per sample: 253.00
|
| 9 |
+
First sample preview: ', maybe annos for their own transportation systems more efficient than acceptable. Personally, I believe that, after see'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.8007773466924935,
|
| 21 |
+
"median_nll": 5.507569789886475,
|
| 22 |
+
"ppl": 330.55641700064734,
|
| 23 |
+
"acc": 0.17892665529062707,
|
| 24 |
+
"tokens": 65049,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 253.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.96
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu1.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu1.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.96_gpu1.json:
|
| 40 |
+
distinct_1: 0.3488
|
| 41 |
+
repetition_1: 0.2891
|
| 42 |
+
d1: 0.3488
|
| 43 |
+
r1: 0.2891
|
| 44 |
+
distinct_2: 0.8615
|
| 45 |
+
repetition_2: 0.0198
|
| 46 |
+
d2: 0.8615
|
| 47 |
+
r2: 0.0198
|
| 48 |
+
distinct_4: 0.9996
|
| 49 |
+
repetition_4: 0.0001
|
| 50 |
+
d4: 0.9996
|
| 51 |
+
r4: 0.0001
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu1.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu2.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.96
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 251)
|
| 8 |
+
Average denoising rounds per sample: 251.00
|
| 9 |
+
First sample preview: ' a form of scummy self-indulgence at an ego tulips at the self, instead of at other," said Washington political analyst '
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.672595226476284,
|
| 21 |
+
"median_nll": 5.31312894821167,
|
| 22 |
+
"ppl": 290.7882172602754,
|
| 23 |
+
"acc": 0.191125388091359,
|
| 24 |
+
"tokens": 65062,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 251.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.96
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu2.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu2.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.96_gpu2.json:
|
| 40 |
+
distinct_1: 0.3354
|
| 41 |
+
repetition_1: 0.2976
|
| 42 |
+
d1: 0.3354
|
| 43 |
+
r1: 0.2976
|
| 44 |
+
distinct_2: 0.8513
|
| 45 |
+
repetition_2: 0.0230
|
| 46 |
+
d2: 0.8513
|
| 47 |
+
r2: 0.0230
|
| 48 |
+
distinct_4: 0.9994
|
| 49 |
+
repetition_4: 0.0002
|
| 50 |
+
d4: 0.9994
|
| 51 |
+
r4: 0.0002
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu2.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu3.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.96
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 254)
|
| 8 |
+
Average denoising rounds per sample: 254.00
|
| 9 |
+
First sample preview: "Microsoft's savage Project Incredible VR is a cyber-punk virtual reality game which functions are psychological arsenal-"
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.729456543464223,
|
| 21 |
+
"median_nll": 5.379550933837891,
|
| 22 |
+
"ppl": 307.801945936048,
|
| 23 |
+
"acc": 0.18857046216291012,
|
| 24 |
+
"tokens": 65042,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 254.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.96
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu3.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu3.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.96_gpu3.json:
|
| 40 |
+
distinct_1: 0.3476
|
| 41 |
+
repetition_1: 0.2958
|
| 42 |
+
d1: 0.3476
|
| 43 |
+
r1: 0.2958
|
| 44 |
+
distinct_2: 0.8540
|
| 45 |
+
repetition_2: 0.0243
|
| 46 |
+
d2: 0.8540
|
| 47 |
+
r2: 0.0243
|
| 48 |
+
distinct_4: 0.9989
|
| 49 |
+
repetition_4: 0.0007
|
| 50 |
+
d4: 0.9989
|
| 51 |
+
r4: 0.0007
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu3.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu4.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.96
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 251)
|
| 8 |
+
Average denoising rounds per sample: 251.00
|
| 9 |
+
First sample preview: '’t think, “that there’s not all,” Give me this whole book it proclaims the life and ’s blood of the real monster, NASCAR'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.7241878748270025,
|
| 21 |
+
"median_nll": 5.377181529998779,
|
| 22 |
+
"ppl": 306.18450410108153,
|
| 23 |
+
"acc": 0.18794402583423037,
|
| 24 |
+
"tokens": 65030,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 251.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.96
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu4.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu4.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.96_gpu4.json:
|
| 40 |
+
distinct_1: 0.3521
|
| 41 |
+
repetition_1: 0.2910
|
| 42 |
+
d1: 0.3521
|
| 43 |
+
r1: 0.2910
|
| 44 |
+
distinct_2: 0.8587
|
| 45 |
+
repetition_2: 0.0219
|
| 46 |
+
d2: 0.8587
|
| 47 |
+
r2: 0.0219
|
| 48 |
+
distinct_4: 0.9992
|
| 49 |
+
repetition_4: 0.0005
|
| 50 |
+
d4: 0.9992
|
| 51 |
+
r4: 0.0005
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu4.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu5.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.96
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 250)
|
| 8 |
+
Average denoising rounds per sample: 250.00
|
| 9 |
+
First sample preview: "'(AmWarning to work..... not because Tikta is interesting or I're doing that' or anything, narunas thought/No, this one "
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.725282199884571,
|
| 21 |
+
"median_nll": 5.394169807434082,
|
| 22 |
+
"ppl": 306.51975287827094,
|
| 23 |
+
"acc": 0.1891035013466718,
|
| 24 |
+
"tokens": 64975,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 250.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.96
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu5.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu5.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.96_gpu5.json:
|
| 40 |
+
distinct_1: 0.3553
|
| 41 |
+
repetition_1: 0.2871
|
| 42 |
+
d1: 0.3553
|
| 43 |
+
r1: 0.2871
|
| 44 |
+
distinct_2: 0.8593
|
| 45 |
+
repetition_2: 0.0212
|
| 46 |
+
d2: 0.8593
|
| 47 |
+
r2: 0.0212
|
| 48 |
+
distinct_4: 0.9991
|
| 49 |
+
repetition_4: 0.0006
|
| 50 |
+
d4: 0.9991
|
| 51 |
+
r4: 0.0006
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu5.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu6.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.96
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 251)
|
| 8 |
+
Average denoising rounds per sample: 251.00
|
| 9 |
+
First sample preview: 'Attendingment inside the panel") is a venue to establish emotional attachment to the things left of you (they\'re now any'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.746712427606919,
|
| 21 |
+
"median_nll": 5.3975830078125,
|
| 22 |
+
"ppl": 313.15943179274166,
|
| 23 |
+
"acc": 0.18455819097947646,
|
| 24 |
+
"tokens": 65096,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 251.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.96
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu6.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu6.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.96_gpu6.json:
|
| 40 |
+
distinct_1: 0.3455
|
| 41 |
+
repetition_1: 0.2982
|
| 42 |
+
d1: 0.3455
|
| 43 |
+
r1: 0.2982
|
| 44 |
+
distinct_2: 0.8554
|
| 45 |
+
repetition_2: 0.0226
|
| 46 |
+
d2: 0.8554
|
| 47 |
+
r2: 0.0226
|
| 48 |
+
distinct_4: 0.9989
|
| 49 |
+
repetition_4: 0.0006
|
| 50 |
+
d4: 0.9989
|
| 51 |
+
r4: 0.0006
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu6.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.96_gpu7.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.96
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 254)
|
| 8 |
+
Average denoising rounds per sample: 254.00
|
| 9 |
+
First sample preview: '\nThe Happ tech application that officials and and developers at the Department of Safety and Human Services are set to s'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.675058493158582,
|
| 21 |
+
"median_nll": 5.313899517059326,
|
| 22 |
+
"ppl": 291.5053891175974,
|
| 23 |
+
"acc": 0.19025290183718963,
|
| 24 |
+
"tokens": 65045,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 254.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.96
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.96_gpu7.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.96_gpu7.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.96_gpu7.json:
|
| 40 |
+
distinct_1: 0.3437
|
| 41 |
+
repetition_1: 0.2939
|
| 42 |
+
d1: 0.3437
|
| 43 |
+
r1: 0.2939
|
| 44 |
+
distinct_2: 0.8529
|
| 45 |
+
repetition_2: 0.0223
|
| 46 |
+
d2: 0.8529
|
| 47 |
+
r2: 0.0223
|
| 48 |
+
distinct_4: 0.9988
|
| 49 |
+
repetition_4: 0.0006
|
| 50 |
+
d4: 0.9988
|
| 51 |
+
r4: 0.0006
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.96_gpu7.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu0.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.98
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 258)
|
| 8 |
+
Average denoising rounds per sample: 258.00
|
| 9 |
+
First sample preview: " new to 'cas' - wasn't Page or Mozilla, or a Newsgram search report. Nor a pay watch - same tech of that investigations "
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.965963974092866,
|
| 21 |
+
"median_nll": 5.685207843780518,
|
| 22 |
+
"ppl": 389.92872815117715,
|
| 23 |
+
"acc": 0.1719249692496925,
|
| 24 |
+
"tokens": 65040,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 258.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.98
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu0.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu0.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.98_gpu0.json:
|
| 40 |
+
distinct_1: 0.3546
|
| 41 |
+
repetition_1: 0.2820
|
| 42 |
+
d1: 0.3546
|
| 43 |
+
r1: 0.2820
|
| 44 |
+
distinct_2: 0.8656
|
| 45 |
+
repetition_2: 0.0175
|
| 46 |
+
d2: 0.8656
|
| 47 |
+
r2: 0.0175
|
| 48 |
+
distinct_4: 0.9995
|
| 49 |
+
repetition_4: 0.0001
|
| 50 |
+
d4: 0.9995
|
| 51 |
+
r4: 0.0001
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu0.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu1.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.98
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 256)
|
| 8 |
+
Average denoising rounds per sample: 256.00
|
| 9 |
+
First sample preview: ', maybe annos for their own transportation systems more efficient than acceptable. Personally, I believe that, after see'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 6.022894606221046,
|
| 21 |
+
"median_nll": 5.761094093322754,
|
| 22 |
+
"ppl": 412.77167961127736,
|
| 23 |
+
"acc": 0.16454527265171687,
|
| 24 |
+
"tokens": 64973,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 256.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.98
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu1.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu1.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.98_gpu1.json:
|
| 40 |
+
distinct_1: 0.3711
|
| 41 |
+
repetition_1: 0.2737
|
| 42 |
+
d1: 0.3711
|
| 43 |
+
r1: 0.2737
|
| 44 |
+
distinct_2: 0.8719
|
| 45 |
+
repetition_2: 0.0174
|
| 46 |
+
d2: 0.8719
|
| 47 |
+
r2: 0.0174
|
| 48 |
+
distinct_4: 0.9994
|
| 49 |
+
repetition_4: 0.0002
|
| 50 |
+
d4: 0.9994
|
| 51 |
+
r4: 0.0002
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu1.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu2.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.98
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 258)
|
| 8 |
+
Average denoising rounds per sample: 258.00
|
| 9 |
+
First sample preview: ' a form of scrawled self-indulgence at an ego tulips onto the self, instead prompts written criticism, said Senate candi'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.992293243009679,
|
| 21 |
+
"median_nll": 5.717593193054199,
|
| 22 |
+
"ppl": 400.331615746006,
|
| 23 |
+
"acc": 0.16747580273467508,
|
| 24 |
+
"tokens": 65090,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 258.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.98
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu2.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu2.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.98_gpu2.json:
|
| 40 |
+
distinct_1: 0.3511
|
| 41 |
+
repetition_1: 0.2760
|
| 42 |
+
d1: 0.3511
|
| 43 |
+
r1: 0.2760
|
| 44 |
+
distinct_2: 0.8615
|
| 45 |
+
repetition_2: 0.0172
|
| 46 |
+
d2: 0.8615
|
| 47 |
+
r2: 0.0172
|
| 48 |
+
distinct_4: 0.9994
|
| 49 |
+
repetition_4: 0.0001
|
| 50 |
+
d4: 0.9994
|
| 51 |
+
r4: 0.0001
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu2.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu3.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.98
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 252)
|
| 8 |
+
Average denoising rounds per sample: 252.00
|
| 9 |
+
First sample preview: "Imagine's revolutionary Blocks arcade mode as a cyber-punk augmented reality game which functions from laser arsenal-lik"
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.9575406407160765,
|
| 21 |
+
"median_nll": 5.658609390258789,
|
| 22 |
+
"ppl": 386.65802293967437,
|
| 23 |
+
"acc": 0.1708832531028437,
|
| 24 |
+
"tokens": 65021,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 252.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.98
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu3.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu3.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.98_gpu3.json:
|
| 40 |
+
distinct_1: 0.3571
|
| 41 |
+
repetition_1: 0.2828
|
| 42 |
+
d1: 0.3571
|
| 43 |
+
r1: 0.2828
|
| 44 |
+
distinct_2: 0.8640
|
| 45 |
+
repetition_2: 0.0189
|
| 46 |
+
d2: 0.8640
|
| 47 |
+
r2: 0.0189
|
| 48 |
+
distinct_4: 0.9994
|
| 49 |
+
repetition_4: 0.0003
|
| 50 |
+
d4: 0.9994
|
| 51 |
+
r4: 0.0003
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu3.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu4.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.98
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 253)
|
| 8 |
+
Average denoising rounds per sample: 253.00
|
| 9 |
+
First sample preview: '’t think, “that there’s not all,” Give me this whole book it proclaims the life and ’s blood of the real monster, NASCAR'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.985462752583502,
|
| 21 |
+
"median_nll": 5.731670618057251,
|
| 22 |
+
"ppl": 397.6064721063864,
|
| 23 |
+
"acc": 0.171787537676078,
|
| 24 |
+
"tokens": 65028,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 253.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.98
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu4.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu4.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.98_gpu4.json:
|
| 40 |
+
distinct_1: 0.3664
|
| 41 |
+
repetition_1: 0.2722
|
| 42 |
+
d1: 0.3664
|
| 43 |
+
r1: 0.2722
|
| 44 |
+
distinct_2: 0.8746
|
| 45 |
+
repetition_2: 0.0163
|
| 46 |
+
d2: 0.8746
|
| 47 |
+
r2: 0.0163
|
| 48 |
+
distinct_4: 0.9997
|
| 49 |
+
repetition_4: 0.0002
|
| 50 |
+
d4: 0.9997
|
| 51 |
+
r4: 0.0002
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu4.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu5.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.98
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 254)
|
| 8 |
+
Average denoising rounds per sample: 254.00
|
| 9 |
+
First sample preview: "'(AmWarning to work..... not because obta is interesting or I're doing that's or anything else narun titles related/No, "
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.945007449058054,
|
| 21 |
+
"median_nll": 5.640978813171387,
|
| 22 |
+
"ppl": 381.84220565183045,
|
| 23 |
+
"acc": 0.17253364090734333,
|
| 24 |
+
"tokens": 65025,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 254.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.98
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu5.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu5.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.98_gpu5.json:
|
| 40 |
+
distinct_1: 0.3613
|
| 41 |
+
repetition_1: 0.2780
|
| 42 |
+
d1: 0.3613
|
| 43 |
+
r1: 0.2780
|
| 44 |
+
distinct_2: 0.8714
|
| 45 |
+
repetition_2: 0.0169
|
| 46 |
+
d2: 0.8714
|
| 47 |
+
r2: 0.0169
|
| 48 |
+
distinct_4: 0.9995
|
| 49 |
+
repetition_4: 0.0002
|
| 50 |
+
d4: 0.9995
|
| 51 |
+
r4: 0.0002
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu5.json
|
eval/top3_latest_test/logs/pps4_lam0.6_temp0.98_gpu6.log
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 2 |
+
Using config from checkpoint:/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt
|
| 3 |
+
Loaded SAD checkpoint: /home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt (step=500000)
|
| 4 |
+
level_lambdas = [0.6]
|
| 5 |
+
leaf_temperature = 0.98
|
| 6 |
+
Generating 128 samples (L=512)...
|
| 7 |
+
sampled 128/128 (steps this call: 253)
|
| 8 |
+
Average denoising rounds per sample: 253.00
|
| 9 |
+
First sample preview: ' Dynamo will acquire stadium licenses on camera video for every venue from experience of one.\n\nMembers of Vancouver-base'
|
| 10 |
+
Loading eval LM: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 11 |
+
Loading eval tokenizer: /home/sunhc/diffusion/sad/models/gpt2-large
|
| 12 |
+
|
| 13 |
+
Eval LM loaded (774,030,080 params)
|
| 14 |
+
Scoring samples under eval LM...
|
| 15 |
+
scored 32/128
|
| 16 |
+
scored 64/128
|
| 17 |
+
scored 96/128
|
| 18 |
+
scored 128/128
|
| 19 |
+
{
|
| 20 |
+
"avg_nll": 5.938803984301763,
|
| 21 |
+
"median_nll": 5.663514137268066,
|
| 22 |
+
"ppl": 379.4807930294375,
|
| 23 |
+
"acc": 0.1718584315593736,
|
| 24 |
+
"tokens": 65071,
|
| 25 |
+
"checkpoint": "/home/sunhc/diffusion/sad/outputs/sad_block_ar_b32_top3/latest.pt",
|
| 26 |
+
"eval_model": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 27 |
+
"eval_tokenizer": "/home/sunhc/diffusion/sad/models/gpt2-large",
|
| 28 |
+
"num_samples": 128,
|
| 29 |
+
"generated_seq_len": 512,
|
| 30 |
+
"mode": "sad_generation",
|
| 31 |
+
"model_type": "block",
|
| 32 |
+
"level_lambdas": "0.6",
|
| 33 |
+
"avg_steps": 253.0,
|
| 34 |
+
"positions_per_step": 4,
|
| 35 |
+
"leaf_temperature": 0.98
|
| 36 |
+
}
|
| 37 |
+
Saved metrics → /home/sunhc/diffusion/sad/eval/top3_latest_test/metrics/pps4_lam0.6_temp0.98_gpu6.json
|
| 38 |
+
Saved samples → /home/sunhc/diffusion/sad/eval/top3_latest_test/samples/pps4_lam0.6_temp0.98_gpu6.json
|
| 39 |
+
Diversity metrics for pps4_lam0.6_temp0.98_gpu6.json:
|
| 40 |
+
distinct_1: 0.3631
|
| 41 |
+
repetition_1: 0.2781
|
| 42 |
+
d1: 0.3631
|
| 43 |
+
r1: 0.2781
|
| 44 |
+
distinct_2: 0.8696
|
| 45 |
+
repetition_2: 0.0176
|
| 46 |
+
d2: 0.8696
|
| 47 |
+
r2: 0.0176
|
| 48 |
+
distinct_4: 0.9995
|
| 49 |
+
repetition_4: 0.0001
|
| 50 |
+
d4: 0.9995
|
| 51 |
+
r4: 0.0001
|
| 52 |
+
num_samples: 128.0000
|
| 53 |
+
Saved -> /home/sunhc/diffusion/sad/eval/top3_latest_test/diversity/pps4_lam0.6_temp0.98_gpu6.json
|