{ "architectures": [ "WavCoch" ], "auto_map": { "AutoConfig": "configuration_wavcoch.WavCochConfig", "AutoModel": "modeling_wavcoch.WavCoch" }, "causal_convs": true, "causal_pad_mode": "repeat", "channels": [ 8, 8, 8, 5, 5, 5 ], "decoder_block_type": "plain", "decoder_dim": 512, "decoder_kernel_size": 9, "decoder_layers": 8, "decoder_residual_bottleneck_factor": 4, "decoder_residual_dilations": [ 1, 3, 9 ], "decoder_residual_kernel_size": 7, "dtype": "float32", "encoder_block_type": "plain", "encoder_dim": 512, "encoder_kernel_size": 3, "encoder_layers": 8, "encoder_residual_bottleneck_factor": 4, "encoder_residual_dilations": [ 1, 3, 9 ], "encoder_residual_kernel_size": 7, "has_vocoder": false, "hop_length": 320, "model_type": "wavcoch", "out_channels": 211, "quantizer": "FSQ", "sample_rate": 16000, "transformers_version": "5.10.2", "vocab_size": 64000, "vocoder_resblock": "1", "vocoder_resblock_dilation_sizes": [ [ 1, 3, 5 ], [ 1, 3, 5 ], [ 1, 3, 5 ] ], "vocoder_resblock_kernel_sizes": [ 11, 7, 3 ], "vocoder_upsample_initial_channel": 512, "vocoder_upsample_kernel_sizes": [ 10, 8, 4, 4 ], "vocoder_upsample_rates": [ 5, 4, 2, 2 ], "window_padding": 1000, "window_size": 1001 }