config: configs/softvq-l-64.yaml exp_index: data_path: /root/data/pub_nas/zhangbq/datasets/imagenet cloud_save_path: experiments/tokenizer no_local_save: true vq_model: SoftVQ vq_ckpt: finetune: false ema: true codebook_size: 8192 codebook_embed_dim: 32 codebook_l2_norm: true codebook_weight: 1.0 entropy_loss_ratio: 0.01 vq_loss_ratio: 0.0 commit_loss_beta: 0.0 reconstruction_weight: 1.0 reconstruction_loss: l2 kl_loss_weight: 1e-06 tau: 0.07 num_codebooks: 4 perceptual_weight: 1.0 perceptual_loss: vgg perceptual_model: vgg perceptual_dino_variants: depth12_no_train perceptual_intermediate_loss: false perceptual_logit_loss: false perceptual_resize: false perceptual_warmup: 10000 disc_weight: 0.2 disc_start: 20000 disc_dim: 64 disc_type: dino disc_loss: hinge gen_loss: hinge lecam_loss_weight: 0.001 use_diff_aug: true disc_cr_loss_weight: 4.0 disc_adaptive_weight: false compile: false dropout_p: 0.0 results_dir: experiments/tokenizer dataset: imagenet image_size: 256 epochs: 50 optimizer: adam lr: 1.0e-4 lr_warmup_epochs: 1 lr_scheduler: cosine weight_decay: 0.0001 beta1: 0.9 beta2: 0.95 max_grad_norm: 1.0 use_ar_mask: true global_batch_size: 256 global_seed: 42 num_workers: 16 log_every: 50 vis_every: 5000 ckpt_every: 10000 gradient_accumulation_steps: 1 mixed_precision: bf16 enc_type: vit dec_type: vit num_latent_tokens: 64 encoder_model: vit_large_patch14_dinov2.lvd142m decoder_model: vit_large_patch14_dinov2.lvd142m encoder_tuning_method: full decoder_tuning_method: full encoder_pretrained: true decoder_pretrained: false encoder_patch_size: 16 decoder_patch_size: 16 repa: true repa_model: vit_large_patch14_dinov2.lvd142m repa_patch_size: 16 repa_proj_dim: 1024 repa_loss_weight: 0.1 repa_align: repeat optim: adamw rank: 0 world_size: 8 gpu: 0 dist_url: env:// distributed: true dist_backend: nccl