dhruvpaleja19's picture
download
raw
5.83 kB
{
"dataset_name": "emilia-s2s",
"artifact_kind": "codec_pretok_tts",
"objective": "named_speaker_text_to_audio",
"export_format": "codec_only",
"prompt_format": "speaker_name_colon_text_audio",
"prompt_template": "{speaker_name}: {transcript}<audio>{mimi_codes}</audio>",
"lang": "hi_en",
"speaker_map": {
"SP_SP010": "Ira",
"SP_SP061": "Aisha",
"SP_SP073": "Siya",
"SP_SP079": "Zoya"
},
"reference_conditioning": {
"enabled": false,
"static_references_emitted": false,
"pairing_rule": "none"
},
"source": {
"gcs_prefix": "gs://gp-s2s-data/s2s-data/emilia-s2s/chunk_00036_200k/parquet",
"shards_requested": 325,
"shards_processed": 325
},
"num_quantizers": 8,
"selection": {
"min_seconds": 1.0,
"max_seconds": 30.0,
"max_samples": 0,
"max_shards": 0,
"start_shard_index": 0,
"validation_ratio": 0.01,
"test_ratio": 0.005,
"split_seed": 42,
"normalize_whitespace": true,
"unknown_speaker_policy": "error"
},
"audio_codec": {
"backend": "mimi",
"source": "hf_pretrained",
"model_ref": "kyutai/mimi",
"sample_rate": 24000,
"codebook_size": 2048,
"max_codebooks": 32,
"encode_downsample": 1920
},
"counts": {
"train": 194797,
"validation": 2055,
"test": 1032
},
"counts_by_speaker": {
"SP_SP010": {
"train": 48763,
"validation": 502,
"test": 286
},
"SP_SP061": {
"train": 48625,
"validation": 494,
"test": 249
},
"SP_SP073": {
"train": 48683,
"validation": 532,
"test": 239
},
"SP_SP079": {
"train": 48726,
"validation": 527,
"test": 258
}
},
"duration_hours": {
"train": 830.477273,
"validation": 8.818905,
"test": 4.387542
},
"dropped": {
"missing_fields": 0,
"unknown_speaker": 0,
"duration": 113,
"decode_error": 0
},
"shard_size": 2048,
"written_files": {
"train": [
"train/part-00000.parquet",
"train/part-00001.parquet",
"train/part-00002.parquet",
"train/part-00003.parquet",
"train/part-00004.parquet",
"train/part-00005.parquet",
"train/part-00006.parquet",
"train/part-00007.parquet",
"train/part-00008.parquet",
"train/part-00009.parquet",
"train/part-00010.parquet",
"train/part-00011.parquet",
"train/part-00012.parquet",
"train/part-00013.parquet",
"train/part-00014.parquet",
"train/part-00015.parquet",
"train/part-00016.parquet",
"train/part-00017.parquet",
"train/part-00018.parquet",
"train/part-00019.parquet",
"train/part-00020.parquet",
"train/part-00021.parquet",
"train/part-00022.parquet",
"train/part-00023.parquet",
"train/part-00024.parquet",
"train/part-00025.parquet",
"train/part-00026.parquet",
"train/part-00027.parquet",
"train/part-00028.parquet",
"train/part-00029.parquet",
"train/part-00030.parquet",
"train/part-00031.parquet",
"train/part-00032.parquet",
"train/part-00033.parquet",
"train/part-00034.parquet",
"train/part-00035.parquet",
"train/part-00036.parquet",
"train/part-00037.parquet",
"train/part-00038.parquet",
"train/part-00039.parquet",
"train/part-00040.parquet",
"train/part-00041.parquet",
"train/part-00042.parquet",
"train/part-00043.parquet",
"train/part-00044.parquet",
"train/part-00045.parquet",
"train/part-00046.parquet",
"train/part-00047.parquet",
"train/part-00048.parquet",
"train/part-00049.parquet",
"train/part-00050.parquet",
"train/part-00051.parquet",
"train/part-00052.parquet",
"train/part-00053.parquet",
"train/part-00054.parquet",
"train/part-00055.parquet",
"train/part-00056.parquet",
"train/part-00057.parquet",
"train/part-00058.parquet",
"train/part-00059.parquet",
"train/part-00060.parquet",
"train/part-00061.parquet",
"train/part-00062.parquet",
"train/part-00063.parquet",
"train/part-00064.parquet",
"train/part-00065.parquet",
"train/part-00066.parquet",
"train/part-00067.parquet",
"train/part-00068.parquet",
"train/part-00069.parquet",
"train/part-00070.parquet",
"train/part-00071.parquet",
"train/part-00072.parquet",
"train/part-00073.parquet",
"train/part-00074.parquet",
"train/part-00075.parquet",
"train/part-00076.parquet",
"train/part-00077.parquet",
"train/part-00078.parquet",
"train/part-00079.parquet",
"train/part-00080.parquet",
"train/part-00081.parquet",
"train/part-00082.parquet",
"train/part-00083.parquet",
"train/part-00084.parquet",
"train/part-00085.parquet",
"train/part-00086.parquet",
"train/part-00087.parquet",
"train/part-00088.parquet",
"train/part-00089.parquet",
"train/part-00090.parquet",
"train/part-00091.parquet",
"train/part-00092.parquet",
"train/part-00093.parquet",
"train/part-00094.parquet",
"train/part-00095.parquet"
],
"validation": [
"validation/part-00000.parquet",
"validation/part-00001.parquet"
],
"test": [
"test/part-00000.parquet"
]
},
"source_scan": {
"scanned": 197997
},
"sample_id_sha256_by_split": {
"train": "a6b90b2ad678cf08c18661f7219c649cee18053dc19f8b3578437830f3bbf612",
"validation": "a885f4dcead087172565c42a773d8526220eb6d614de17989b8b7bb52bf79568",
"test": "58561dd7d1d4a3c7016668fd828b254b2930eb96bf012919ae9cff645aa112a5"
},
"fingerprint_sha256": "8cff46ccaae210ea1e6c1fabeebe018b486bee0051da336e61e892a5578b1f28"
}

Xet Storage Details

Size:
5.83 kB
·
Xet hash:
1ca5c93a9cc99dd3f3a4737c8a39c6fa35bb6bdb17793b5b3b7cc17ed60cba22

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.