Whisper Large V3 — Swahili NSS (AfriVoice Education Domain)

Stage 2 nonstandard speech fine-tune of openai/whisper-large-v3 on the CDLI Kenyan Swahili Nonstandard Speech dataset. Built on top of ElizabethMwangi/whisper-large-v3-swahili-afrivoice, a Stage 1 checkpoint trained on AfriVoice education-domain speech.

Training Details

  • Stage 1 base: ElizabethMwangi/whisper-large-v3-swahili-afrivoice (AfriVoice education domain)
  • Stage 2 dataset: cdli/kenyan_swahili_nonstandard_speech_v1.0 (849 examples)
  • Language token: sw
  • Full model training: encoder, decoder, and projection updated
  • SpecAugment: On
  • Learning rate: 5e-5 (polynomial decay, warmup 40 steps)
  • Max steps: 1000
  • Best checkpoint: step 750
  • Output dir: sw_nss_tune_whisper_v3_large_afrivoice_v1.1

Results on Kenyan Swahili Nonstandard Speech (test set, best checkpoint)

Overall, compared to unadapted baseline

Model Overall WER Avg WER
openai/whisper-large-v3 (no adaptation) 0.845 -
This model (adapted) 0.307 0.272
Metric Value
Overall WER 0.307
Overall CER 0.146
Avg WER 0.272
Avg CER 0.122
Meaning preservation 78.9%

By severity

Severity WER CER
Mild 0.20 0.08
Moderate 0.24 0.11
Severe 0.34 0.16
Downloads last month
7
Safetensors
Model size
2B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ElizabethMwangi/whisper-large-v3-swahili-nss-afrivoice-edu

Datasets used to train ElizabethMwangi/whisper-large-v3-swahili-nss-afrivoice-edu