2.61 GB
102 files
Updated about 2 months ago
Name
Size
validation
train
test
dataset_manifest.json5.83 kB
xet
README.md694 Bytes
xet
.gitattributes2.5 kB
xet
README.md

Emilia S2S Mimi Q8 Named Speakers

TinyAya codec-tokenized TTS dataset built from gs://gp-s2s-data/s2s-data/emilia-s2s/chunk_00036_200k/parquet.

Rows are Mimi codec-only examples. The training text field already includes the user-facing speaker prefix:

Ira: transcript...

Speaker mapping:

  • SP_SP010 -> Ira:
  • SP_SP061 -> Aisha:
  • SP_SP073 -> Siya:
  • SP_SP079 -> Zoya:

Reference conditioning is disabled for this artifact. No ref_* fields are emitted.

Total size
2.61 GB
Files
102
Last updated
Jun 8
Pre-warmed CDN
US EU US EU

Contributors