Whisper Large V3 - Swahili Afrivoice (All 5 Domains)

Fine-tuned on all 5 domains of Swahili Afrivoice dataset (389,599 utterances).

Training Details

Parameter Value
Base Model openai/whisper-large-v3
Language Swahili (sw)
Task Transcribe
Dataset All 5 domains (389,599 utterances)
Max Steps 1000
Best Checkpoint Step 600
Batch Size 4 (effective batch 32)
Learning Rate 1e-5
SpecAugment Enabled

Results

Dataset WER
Afrivoice (Avg WER) 10.9%
Common Voice Swahili 29.7%
Non-standard Speech 43.4%

Usage

from transformers import pipeline

asr = pipeline("automatic-speech-recognition", model="ElizabethMwangi/whisper-large-v3-swahili-afrivoice-5domains")
result = asr("audio.wav")
print(result["text"])
Downloads last month
8
Safetensors
Model size
2B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ElizabethMwangi/whisper-large-v3-swahili-afrivoice-5domains

Finetuned
(899)
this model
Finetunes
1 model

Dataset used to train ElizabethMwangi/whisper-large-v3-swahili-afrivoice-5domains