name: checkpoint model_family: wav2vec2_asr model_config: encoder_config: model_dim: 1024 max_seq_len: 4096 feature_dim: 512 use_fbank: false first_pass_dropout_p: 0.0 layer_norm_features: false feature_extractor_layer_descs: - - 512 - 10 - 5 - - 512 - 3 - 2 - - 512 - 3 - 2 - - 512 - 3 - 2 - - 512 - 3 - 2 - - 512 - 2 - 2 - - 512 - 2 - 2 feature_extractor_bias: true feature_extractor_layer_norm_convs: true feature_grad_scale: 0.1 num_fbank_channels: 0 fbank_stride: 0 sample_fbank_every_k: 0 pos_encoder_type: conv pos_encoder_depth: 1 pos_conv_kernel_size: 128 num_pos_conv_groups: 16 use_conformer: false num_encoder_layers: 24 num_encoder_attn_heads: 16 ffn_inner_dim: 4096 dropout_p: 0.0 attn_dropout_p: 0.0 ffn_inner_dropout_p: 0.1 layer_drop_p: 0.1 norm_order: PRE depthwise_conv_kernel_size: 0 target_vocab_size: 10288 final_dropout_p: 0.0 use_masking: false temporal_mask_span_len: 10 max_temporal_mask_prob: 0.0 min_num_temporal_mask_spans: 2 spatial_mask_span_len: 64 max_spatial_mask_prob: 0.0 min_num_spatial_mask_spans: 2