--- language: ar tags: - text-to-speech - egyptian-arabic - voice-cloning - vibevoice --- # VibeVoice Egyptian Arabic — cfg_scale=4.0 Fine-tuned VibeVoice on Egyptian Arabic dialect (checkpoint-9160). ## cfg_scale=4.0 Balanced quality. Best tested result — recommended starting point. _Stops cleanly at EOS. Slight loudness drift on scripts over 40 seconds._ ## Repo contents | File | Description | |---|---| | `model.safetensors` | Merged model weights (5.1 GB, single shard) | | `config.json` | Model architecture config | | `tokenizer.json` + friends | Qwen2.5 tokenizer files | | `preprocessor_config.json` | Audio processor settings | | `voices/egyptian_male.wav` | Reference voice for male speaker | | `voices/egyptian_female.wav` | Reference voice for female speaker | | `samples/demo_cfg4.0.wav` | Sample output at this cfg_scale | ## Backend usage ```python from huggingface_hub import hf_hub_download, snapshot_download snapshot_download("MohammedEhab20/vibe-voice-egyptian-cfg40", local_dir="./model") male_voice = "./model/voices/egyptian_male.wav" female_voice = "./model/voices/egyptian_female.wav" # Run inference: # python inference_from_file.py --model_path ./model --cfg_scale 4.0 ... ```