| datasets>=2.20.0 | |
| huggingface-hub>=0.24.0,<1.0 | |
| gradio==5.49.1 | |
| numpy>=1.24 | |
| PyYAML>=6.0 | |
| scikit-learn>=1.4 | |
| soundfile>=0.12 | |
| speechbrain>=1.0.0 | |
| torch>=2.2 | |
| torchaudio>=2.2 | |
| tqdm>=4.66 | |
| datasets>=2.20.0 | |
| huggingface-hub>=0.24.0,<1.0 | |
| gradio==5.49.1 | |
| numpy>=1.24 | |
| PyYAML>=6.0 | |
| scikit-learn>=1.4 | |
| soundfile>=0.12 | |
| speechbrain>=1.0.0 | |
| torch>=2.2 | |
| torchaudio>=2.2 | |
| tqdm>=4.66 | |