hululuhu commited on
Commit
8e8d9e5
·
1 Parent(s): 4f04137

update readme

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ *.jpg filter=lfs diff=lfs merge=lfs -text
README.md CHANGED
@@ -16,6 +16,11 @@ The model can synthesize speech up to **90 minutes** long with up to **4 distinc
16
 
17
  ➡️ **Code:** [microsoft/VibeVoice-Code](https://github.com/microsoft/VibeVoice)
18
 
 
 
 
 
 
19
  ## Training details
20
  Transformer-based Large Language Model (LLM) integrated with specialized acoustic and semantic tokenizers and a diffusion-based decoding head.
21
  - LLM: [Qwen2.5-1.5B](https://huggingface.co/Qwen/Qwen2.5-1.5B) for this release.
 
16
 
17
  ➡️ **Code:** [microsoft/VibeVoice-Code](https://github.com/microsoft/VibeVoice)
18
 
19
+ <p align="left">
20
+ <img src="figures/VibeVoice.jpg" alt="VibeVoice Overview" height="250px" style="margin-right: 10px;">
21
+ <img src="figures/MOS-preference.png" alt="MOS Preference Results" height="260px">
22
+ </p>
23
+
24
  ## Training details
25
  Transformer-based Large Language Model (LLM) integrated with specialized acoustic and semantic tokenizers and a diffusion-based decoding head.
26
  - LLM: [Qwen2.5-1.5B](https://huggingface.co/Qwen/Qwen2.5-1.5B) for this release.
figures/MOS-preference.png ADDED
figures/VibeVoice.jpg ADDED

Git LFS Details

  • SHA256: 353803ce2be393700ff3dfedd0a522b88ebd294702d0d2f51b6f7b7fe65d344f
  • Pointer size: 131 Bytes
  • Size of remote file: 342 kB