{ "model_name_or_path": "jhu-clsp/mmBERT-base", "rope_scaling_type": "yarn", "rope_original_max_position_embeddings": 8192, "yarn_beta_fast": 32.0, "yarn_beta_slow": 1.0, "yarn_extrapolation_factor": 1.0, "dataset_path": "/data/modernbert-32k-training/tokenized_dataset_32k", "model_max_length": 32768, "mlm_probability": 0.3, "max_train_samples": null, "dataloader_num_workers": 4, "output_dir": "/data/modernbert-32k-training/output/mmbert-32k-yarn", "per_device_train_batch_size": 1, "gradient_accumulation_steps": 16, "learning_rate": 1e-05, "weight_decay": 0.01, "warmup_steps": 100, "warmup_ratio": 0.1, "num_train_epochs": 1, "max_grad_norm": 1.0, "lr_scheduler_type": "constant_with_warmup", "use_retrieval_masking": false, "retrieval_probability": 0.1, "min_distance_for_retrieval": 512, "use_ewc": false, "ewc_lambda": 1000.0, "ewc_samples": 200, "bf16": true, "logging_steps": 10, "save_steps": 500, "seed": 42 }