| { |
| "run_name": "simnpo_gemma-3-12b-pt_20260427_203900", |
| "run_dir": "/runs/simnpo_gemma-3-12b-pt_20260427_203900", |
| "config": { |
| "model_name": "google/gemma-3-12b-pt", |
| "forget_path": "unlearning-cleanslate/fsid-curated-gemma-12b:forget:baseline", |
| "retain_path": "unlearning-cleanslate/fsid-curated-gemma-12b:retain:baseline", |
| "output_dir": "/runs", |
| "objective": "simnpo", |
| "num_epochs": 2, |
| "batch_size": 8, |
| "gradient_accum_steps": 4, |
| "lr": 5e-05, |
| "weight_decay": 0.0, |
| "warmup_steps": 10, |
| "max_grad_norm": 1.0, |
| "forget_weight": 5.0, |
| "retain_weight": 1.0, |
| "retain_loss_type": "nll", |
| "npo_beta": 2.0, |
| "simnpo_delta": 0.25, |
| "rmu_steering_coeff": 2.0, |
| "rmu_module_regex": "model\\.layers\\.7", |
| "rmu_control_vec_seed": 0, |
| "undial_beta": 10.0, |
| "save_every": 200, |
| "fsdp_sharding_strategy": "full_shard", |
| "dtype": "bfloat16", |
| "seed": 42, |
| "num_workers": 0, |
| "log_every": 10, |
| "gradient_checkpointing": false, |
| "torch_compile": false, |
| "push_to_hub": true, |
| "hub_repo_id": "unlearning-cleanslate/gemma-3-12b-simnpo-baseline", |
| "hub_private": false, |
| "optim": "adamw_torch" |
| }, |
| "num_forget_rows": 27936, |
| "num_forget_pairs": 27936, |
| "num_retain_rows": 1646, |
| "num_retain_sequences": 1646, |
| "num_trainable_params": 12187325040, |
| "num_total_params": 12187325040, |
| "run_seconds": 5790.328476428986, |
| "checkpoint_dir": "/runs/simnpo_gemma-3-12b-pt_20260427_203900", |
| "is_main_process": true |
| } |