{ "adapter_sha256": "dcc5f50ea32fe0d59f5dfb1d02fda4996e54a2088618eb622e71f2e0c5dfe693", "adapter_step": 162, "base_model_id": "Qwen/Qwen2.5-VL-3B-Instruct", "levers": { "max_pixels": 200704, "max_seq_len": 1024, "min_pixels": 3136 }, "lora": { "lora_alpha": 32, "lora_dropout": 0.05, "lora_r": 16, "lora_target_modules": [ "q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj" ] }, "optim": { "effective_batch_size": 32, "epochs": 2, "gradient_accumulation_steps": 32, "gradient_checkpointing": true, "learning_rate_lora": 0.0002, "max_grad_norm": 1.0, "per_device_batch_size": 1, "scheduler": "cosine", "seed": 0, "warmup_ratio": 0.03 }, "quantization": { "bnb_4bit_compute_dtype": "bfloat16", "bnb_4bit_quant_type": "nf4", "bnb_4bit_use_double_quant": true, "load_in_4bit": true }, "run_id": "bl_a0ccbcff", "stage": "sft_qlora", "tied_embedding_status": "tied", "tokenizer_version": "vq_v2_srgbres_17to4_cb256_t64__w91cffdd2c82f", "train_report": { "epochs": 2, "mean_loss": 1.9172154127758134, "rows": 2864, "rows_trained": 5184, "seed": 0, "skipped": 544, "smoke_size": null, "steps": 162 }, "vocab_size_after_resize": 151924, "vq_codebook_sha256": "bcdf369dd7cd9a99d71f240b0dac67d404f52130dc8c35d14d6a04514349d118" }