| name: checkpoint | |
| model_family: wav2vec2_asr | |
| model_config: | |
| encoder_config: | |
| model_dim: 1024 | |
| max_seq_len: 4096 | |
| feature_dim: 512 | |
| use_fbank: false | |
| first_pass_dropout_p: 0.0 | |
| layer_norm_features: false | |
| feature_extractor_layer_descs: | |
| - - 512 | |
| - 10 | |
| - 5 | |
| - - 512 | |
| - 3 | |
| - 2 | |
| - - 512 | |
| - 3 | |
| - 2 | |
| - - 512 | |
| - 3 | |
| - 2 | |
| - - 512 | |
| - 3 | |
| - 2 | |
| - - 512 | |
| - 2 | |
| - 2 | |
| - - 512 | |
| - 2 | |
| - 2 | |
| feature_extractor_bias: true | |
| feature_extractor_layer_norm_convs: true | |
| feature_grad_scale: 0.1 | |
| num_fbank_channels: 0 | |
| fbank_stride: 0 | |
| sample_fbank_every_k: 0 | |
| pos_encoder_type: conv | |
| pos_encoder_depth: 1 | |
| pos_conv_kernel_size: 128 | |
| num_pos_conv_groups: 16 | |
| use_conformer: false | |
| num_encoder_layers: 24 | |
| num_encoder_attn_heads: 16 | |
| ffn_inner_dim: 4096 | |
| dropout_p: 0.0 | |
| attn_dropout_p: 0.0 | |
| ffn_inner_dropout_p: 0.1 | |
| layer_drop_p: 0.1 | |
| norm_order: PRE | |
| depthwise_conv_kernel_size: 0 | |
| target_vocab_size: 10288 | |
| final_dropout_p: 0.0 | |
| use_masking: false | |
| temporal_mask_span_len: 10 | |
| max_temporal_mask_prob: 0.0 | |
| min_num_temporal_mask_spans: 2 | |
| spatial_mask_span_len: 64 | |
| max_spatial_mask_prob: 0.0 | |
| min_num_spatial_mask_spans: 2 | |