{ "adapter_artifact": { "adapter_model": { "bytes": 349243752, "sha256": "e949ee36800f429ba5dc02b761aa54bf8037af6d406fac9e5a04c7b68cce4a12", "tensor_count": 504 }, "published_adapter_config_sha256": "a1036d4a3bf1ded9718ad7a3c555ab989243bf8ce0aec8949d5ca2a79e2b06be", "published_metadata_change": "Set adapter_config.json revision from null to the immutable base revision in the training receipt; weights and tokenizer artifacts are unchanged.", "source_zip": { "bytes": 325882649, "crc_test_passed": true, "duplicates_present": false, "sha256": "e00dcb7653e9baa19fb103bbe0712b419fccb281724b487847de7f03a960c7fb", "symlinks_present": false, "unsafe_paths_present": false } }, "base_model": { "repo_id": "unsloth/Qwen3-8B-bnb-4bit", "revision": "1deaf68f694c40dbce295da300851729d759b21a" }, "benchmark": { "frozen_items": 140, "frozen_sha256": "546c14f03707ce098146dac5e0c6e99c0a4619d6d4e32193a9fff4e3b9bfd1b1", "measured_metrics": { "opus_generator_baseline": { "hardened_computation_validity": { "ci95_percent": [ 34.2, 47.4 ], "denominator": 422, "numerator": 170, "score_percent": 40.3 }, "no_answer_equals_key": { "ci95_percent": [ 89.1, 97.1 ], "denominator": 140, "numerator": 132, "score_percent": 94.3 }, "three_distinct_answers": { "ci95_percent": [ 78.2, 90.0 ], "denominator": 140, "numerator": 119, "score_percent": 85.0 }, "three_distinct_misconceptions": { "ci95_percent": [ 92.9, 98.9 ], "denominator": 140, "numerator": 136, "score_percent": 97.1 }, "valid_exactly_three": { "ci95_percent": [ 92.9, 98.9 ], "denominator": 140, "numerator": 136, "score_percent": 97.1 } }, "v8_model_only": { "generation": "deterministic greedy", "hardened_computation_validity": { "ci95_percent": [ 73.3, 84.5 ], "denominator": 420, "numerator": 333, "score_percent": 79.3 }, "no_answer_equals_key": { "ci95_percent": [ 89.1, 97.1 ], "denominator": 140, "numerator": 132, "score_percent": 94.3 }, "three_distinct_answers": { "ci95_percent": [ 73.4, 86.4 ], "denominator": 140, "numerator": 113, "score_percent": 80.7 }, "three_distinct_misconceptions": { "ci95_percent": [ 97.3, 100.0 ], "denominator": 140, "numerator": 140, "score_percent": 100.0 }, "track_type": "model_only", "valid_exactly_three": { "ci95_percent": [ 97.3, 100.0 ], "denominator": 140, "numerator": 140, "score_percent": 100.0 } }, "v8_verifier_guided_best_of_4": { "candidate_count": 4, "generation": "one greedy candidate plus three seeded sampled candidates, selected by a deterministic local verifier", "hardened_computation_validity": { "ci95_percent": [ 79.0, 89.3 ], "denominator": 420, "numerator": 356, "score_percent": 84.8 }, "no_answer_equals_key": { "ci95_percent": [ 91.9, 98.5 ], "denominator": 140, "numerator": 135, "score_percent": 96.4 }, "three_distinct_answers": { "ci95_percent": [ 91.9, 98.5 ], "denominator": 140, "numerator": 135, "score_percent": 96.4 }, "three_distinct_misconceptions": { "ci95_percent": [ 97.3, 100.0 ], "denominator": 140, "numerator": 140, "score_percent": 100.0 }, "track_type": "system", "valid_exactly_three": { "ci95_percent": [ 97.3, 100.0 ], "denominator": 140, "numerator": 140, "score_percent": 100.0 } } }, "method": "Deterministic local hard gates on the sealed v8 Number benchmark; intervals are 95%.", "registered_verdict": { "v8_model_only": "NOT DEMONSTRATED", "v8_verifier_guided_best_of_4": "NOT DEMONSTRATED" }, "unavailable_metrics": { "diagnostic_quality_or_plausibility": "No accepted independent judge or completed human review.", "good_at_3": "GDR is unavailable.", "good_distractor_rate": "No accepted independent judge for holistic misconception mapping, specificity, plausibility, and diagnostic usefulness.", "observed_student_pick_frequency": "No student option-selection frequency data exists for this benchmark." } }, "model_id": "j2ampn/qwen3-8b-distractor-lora-v8", "schema_version": "diagnostic-distractor-v8-benchmark-summary-v1", "source_evidence": { "artifact_validation": { "sha256": "6accd30757d0023eed252c45ba8f02a1e3499372782e6fbb7daeda53a13b7f7c", "url": "https://github.com/jsonjj/diagnostic-distractor-slm/blob/5aa7146b0fa7fc71efbd10feac4e57c2839e05a4/data/eval_out/v8_artifact_validation.json" }, "final_benchmark": { "sha256": "419ec4a7f9b8c3e4baef1830582b0c54225be315d0cc740d517575aa208c1368", "url": "https://github.com/jsonjj/diagnostic-distractor-slm/blob/5aa7146b0fa7fc71efbd10feac4e57c2839e05a4/data/eval_out/benchmark_v8_final.json" }, "final_results": { "sha256": "388b9d28267d9fc25aeef4bb885816b9764dfa94cba3c43c7475b0aa19b4ae9e", "url": "https://github.com/jsonjj/diagnostic-distractor-slm/blob/5aa7146b0fa7fc71efbd10feac4e57c2839e05a4/TABLE_V8_RESULTS.md" }, "repository": "https://github.com/jsonjj/diagnostic-distractor-slm", "source_revision": "5aa7146b0fa7fc71efbd10feac4e57c2839e05a4", "training_receipt": { "sha256": "a88a1ca6dae5611ee64e34f7ecb236a17c82809f1a4f053c5daaa701c7e00571", "url": "https://github.com/jsonjj/diagnostic-distractor-slm/blob/5aa7146b0fa7fc71efbd10feac4e57c2839e05a4/v8_training_receipt.json" } }, "training": { "best_checkpoint": "outputs_v8/checkpoint-403", "best_eval_loss": 0.051324423402547836, "epochs_planned": 3, "learning_rate": 0.00015, "lora_alpha": 32, "lora_rank": 32, "seed": 42, "train_rows": 3572, "train_sha256": "babe071e310a389b8a0fb2d3a5b6414f1275129f3cad8c15be5ff175e098a5ad" } }