| model_name: allenai/Olmo-3-1025-7B | |
| forget_path: unlearning-cleanslate/fsid-curated-olmo-7b:forget:baseline | |
| retain_path: unlearning-cleanslate/fsid-curated-olmo-7b:retain:baseline | |
| output_dir: /runs | |
| objective: simnpo | |
| num_epochs: 2 | |
| batch_size: 8 | |
| gradient_accum_steps: 4 | |
| lr: 5.0e-05 | |
| weight_decay: 0.0 | |
| warmup_steps: 10 | |
| max_grad_norm: 1.0 | |
| forget_weight: 5.0 | |
| retain_weight: 1.0 | |
| retain_loss_type: nll | |
| npo_beta: 2.0 | |
| simnpo_delta: 0.25 | |
| rmu_steering_coeff: 2.0 | |
| rmu_module_regex: model\.layers\.7 | |
| rmu_control_vec_seed: 0 | |
| undial_beta: 10.0 | |
| save_every: 200 | |
| fsdp_sharding_strategy: full_shard | |
| dtype: bfloat16 | |
| seed: 42 | |
| num_workers: 0 | |
| log_every: 10 | |
| gradient_checkpointing: false | |
| torch_compile: false | |
| push_to_hub: true | |
| hub_repo_id: unlearning-cleanslate/olmo-3-7b-simnpo-baseline | |
| hub_private: false | |
| optim: adamw_torch | |
| _run_name: simnpo_Olmo-3-1025-7B_20260428_231931 | |
| _run_dir: /runs/simnpo_Olmo-3-1025-7B_20260428_231931 | |