MohammedEhab20's picture
Add voices, sample audio, README for cfg_scale=4.0
c2cb721 verified
|
Raw
History Blame Contribute Delete
1.22 kB
metadata
language: ar
tags:
  - text-to-speech
  - egyptian-arabic
  - voice-cloning
  - vibevoice

VibeVoice Egyptian Arabic — cfg_scale=4.0

Fine-tuned VibeVoice on Egyptian Arabic dialect (checkpoint-9160).

cfg_scale=4.0

Balanced quality. Best tested result — recommended starting point.

Stops cleanly at EOS. Slight loudness drift on scripts over 40 seconds.

Repo contents

File Description
model.safetensors Merged model weights (5.1 GB, single shard)
config.json Model architecture config
tokenizer.json + friends Qwen2.5 tokenizer files
preprocessor_config.json Audio processor settings
voices/egyptian_male.wav Reference voice for male speaker
voices/egyptian_female.wav Reference voice for female speaker
samples/demo_cfg4.0.wav Sample output at this cfg_scale

Backend usage

from huggingface_hub import hf_hub_download, snapshot_download
snapshot_download("MohammedEhab20/vibe-voice-egyptian-cfg40", local_dir="./model")
male_voice   = "./model/voices/egyptian_male.wav"
female_voice = "./model/voices/egyptian_female.wav"
# Run inference:
# python inference_from_file.py --model_path ./model --cfg_scale 4.0 ...