{ "engine": "bicodec", "components": { "wav2vec2_encoder": "wav2vec2_encoder.onnx", "wav2vec2_encoder_q8": "wav2vec2_encoder_q8.onnx", "semantic_encoder": "semantic_encoder.onnx", "semantic_encoder_q8": "semantic_encoder_q8.onnx", "global_encoder": "global_encoder.onnx", "global_encoder_q8": "global_encoder_q8.onnx", "mel_filterbank": "mel_filterbank.npy", "mel_config": "mel_config.json", "decoder": "decoder.onnx", "decoder_q8": "decoder_q8.onnx" }, "sample_rates": { "input": 16000, "output": 16000 }, "distributable": true, "metadata": { "opset": 14, "sample_rate": 16000, "global_token_num": 32, "wav2vec2_layers": [ 11, 14, 16 ], "vc_recipe": "source semantic tokens (content) + reference global tokens (timbre) \u2192 decode", "parity": { "wav2vec2_encoder": { "max_abs": 0.000671, "pass": true }, "semantic_encoder": { "exact_int_match": true, "pass": true }, "global_encoder": { "exact_int_match": true, "pass": true }, "mel_numpy_vs_torchaudio": { "max_abs": 0.0, "pass": true }, "decoder": { "max_abs": 2.5266781449317932e-06, "pass": true } } } }