Automatic Speech Recognition
Transformers
TensorBoard
Safetensors
Serbian
whisper
Generated from Trainer
Eval Results (legacy)
Instructions to use Sagicc/whisper-small-sr-combined with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Sagicc/whisper-small-sr-combined with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("automatic-speech-recognition", model="Sagicc/whisper-small-sr-combined")# Load model directly from transformers import AutoProcessor, AutoModelForSpeechSeq2Seq processor = AutoProcessor.from_pretrained("Sagicc/whisper-small-sr-combined") model = AutoModelForSpeechSeq2Seq.from_pretrained("Sagicc/whisper-small-sr-combined", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Побољшање модела
#1
by mllearner123 - opened
Хвала за модел.
Видим да имаш хардверске ресурсе за тренирање модела. Имам предлог за finetune-овање још бољег модела
искористи ParlaSpeech скупове података са хрватског за претренирање модела (ћирилизуј њихове текстове да би излазни текст токени остали исти)
затим тренирај на српском ParlaSpeech скупу и на крају на скупу Јужне вести
а имаш и CommonVoice датасет за српски,
https://huggingface.co/datasets/shunyalabs/serbian-speech-dataset
такође имаш NVIDIA модел и њихов генерисани датасет за хрватски који такође може да се искористи у фази претренирања
https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3
https://huggingface.co/datasets/nvidia/Granary