name: state_halt checkpoint: null device: cuda kwargs: cell_set_len: 512 blur: 0.05 hidden_dim: 768 loss: energy confidence_token: True n_encoder_layers: 1 n_decoder_layers: 1 predict_residual: True softplus: True freeze_pert_backbone: False transformer_decoder: False finetune_vci_decoder: False residual_decoder: False batch_encoder: False use_batch_token: False mask_attn: False # --- adaptive-depth halting (joint calibration, user §4.4/§4.5) --- n_refine_rounds: 6 halt_tau: 0.05 halt_alpha: 0.5 halt_beta: 0.1 halt_gamma: 0.01 halt_warmup_steps: 2000 halt_magnitude_free: true confidence_weight: 0.01 confidence_target_scale: 10.0 use_effect_gating_token: False distributional_loss: energy init_from: null mmd_num_chunks: 1 randomize_mmd_chunks: false llm_name: null transformer_backbone_key: llama transformer_backbone_kwargs: bidirectional_attention: true max_position_embeddings: ${model.kwargs.cell_set_len} hidden_size: ${model.kwargs.hidden_dim} intermediate_size: 3072 num_hidden_layers: 8 num_attention_heads: 12 num_key_value_heads: 12 head_dim: 64 use_cache: false attention_dropout: 0.0 hidden_dropout: 0.0 layer_norm_eps: 1e-6 pad_token_id: 0 bos_token_id: 1 eos_token_id: 2 tie_word_embeddings: false rotary_dim: 0 use_rotary_embeddings: false lora: enable: false r: 16 alpha: 32 dropout: 0.05 bias: none target: auto adapt_mlp: false task_type: FEATURE_EXTRACTION merge_on_eval: false