{ "fine_tuned": { "model": "opus-mt-en-vi-finetuned (1 epoch)", "samples": 17272, "bleu": 29.29, "chrfpp": 49.13, "runtime_minutes": 64.8, "speed_samples_per_second": 4.44, "batch_size": 16, "num_beams": 4, "max_length": 256, "max_new_tokens": 256 }, "baseline": { "model": "Helsinki-NLP/opus-mt-en-vi", "samples": 17272, "bleu": 3.73, "chrfpp": 20.87, "runtime_minutes": 28.8, "speed_samples_per_second": 10.0, "batch_size": 256, "num_beams": 4, "fp16": true }, "sanity_check_256": { "baseline_fp32_bs16": { "bleu": 3.53, "chrfpp": 20.5, "speed_sps": 4.72 }, "baseline_fp16_bs256": { "bleu": 3.57, "chrfpp": 20.56, "speed_sps": 10.01 }, "fine_tuned_fp16_bs256": { "bleu": 29.01, "chrfpp": 49.07, "speed_sps": 9.79 } }, "training": { "base_model": "Helsinki-NLP/opus-mt-en-vi", "epochs": 1, "train_samples_approx": "328K", "val_samples_full": 17272, "batch_size": 16, "eval_samples_during_training": 128, "train_loss": 1.959, "eval_loss": 1.496, "eval_bleu_during_training": 34.29, "eval_chrf_during_training": 54.54, "train_runtime_hours": 3.26, "gpu": "NVIDIA L4", "colab_ram_gb": 53, "colab_gpu_ram_gb": 22.5 } }