{ "model_name": "meta-llama/Llama-3.1-8B-Instruct", "run_name": "clinical-agent-transformer-mcp-full", "seq_len": 1024, "micro_batch_size": 1, "gradient_accumulation_steps": 8, "learning_rate": 2e-05, "train_steps": 1200, "warmup_steps": 100, "weight_decay": 0.01, "use_bf16": true, "gradient_checkpointing": true, "hf_cache_dir": "/cache/huggingface", "dataset_dir": "/root/generated_data", "checkpoint_dir": "/checkpoints", "output_dir": "/checkpoints/runs", "train_jsonl": "/root/generated_data/amr_mcp_traces_balanced_v1.jsonl", "text_field": "text_trace", "max_records": null, "validation_fraction": 0.1, "resume_trainable_state": "/checkpoints/runs/clinical-agent-transformer-clinical-full/trainable_state.pt", "log_every": 25, "eval_every": 100, "checkpoint_every": 0, "max_eval_batches": 75, "seed": 42, "optimizer_name": "adam8bit", "freeze_base_model": false, "adapter": "AdapterConfig(enabled=True, adapter_name='clinical_agent_adapter', r=8, lora_alpha=32, lora_dropout=0.05, target_modules=('q_proj', 'k_proj', 'v_proj', 'o_proj'))", "surgery": "SurgeryConfig(use_mla=True, use_qk_norm=True, use_post_norm=True, use_moe_layers=True, use_recurrent_layers=True, use_mtp_head=True, qk_norm_layers=(), qk_norm_eps=1e-05, mla_layers=(), moe_layers=(), recurrent_layers=())" }