| { | |
| "engine": "bicodec", | |
| "components": { | |
| "wav2vec2_encoder": "wav2vec2_encoder.onnx", | |
| "wav2vec2_encoder_q8": "wav2vec2_encoder_q8.onnx", | |
| "semantic_encoder": "semantic_encoder.onnx", | |
| "semantic_encoder_q8": "semantic_encoder_q8.onnx", | |
| "global_encoder": "global_encoder.onnx", | |
| "global_encoder_q8": "global_encoder_q8.onnx", | |
| "mel_filterbank": "mel_filterbank.npy", | |
| "mel_config": "mel_config.json", | |
| "decoder": "decoder.onnx", | |
| "decoder_q8": "decoder_q8.onnx" | |
| }, | |
| "sample_rates": { | |
| "input": 16000, | |
| "output": 16000 | |
| }, | |
| "distributable": true, | |
| "metadata": { | |
| "opset": 14, | |
| "sample_rate": 16000, | |
| "global_token_num": 32, | |
| "wav2vec2_layers": [ | |
| 11, | |
| 14, | |
| 16 | |
| ], | |
| "vc_recipe": "source semantic tokens (content) + reference global tokens (timbre) \u2192 decode", | |
| "parity": { | |
| "wav2vec2_encoder": { | |
| "max_abs": 0.000671, | |
| "pass": true | |
| }, | |
| "semantic_encoder": { | |
| "exact_int_match": true, | |
| "pass": true | |
| }, | |
| "global_encoder": { | |
| "exact_int_match": true, | |
| "pass": true | |
| }, | |
| "mel_numpy_vs_torchaudio": { | |
| "max_abs": 0.0, | |
| "pass": true | |
| }, | |
| "decoder": { | |
| "max_abs": 2.5266781449317932e-06, | |
| "pass": true | |
| } | |
| } | |
| } | |
| } |