Image Feature Extraction
Transformers
Safetensors
English
vision
sar
remote-sensing
synthetic-aperture-radar
masked-autoencoder
model-hub
Instructions to use BiliSakura/SARMAE-transformers with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use BiliSakura/SARMAE-transformers with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-feature-extraction", model="BiliSakura/SARMAE-transformers")# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("BiliSakura/SARMAE-transformers", device_map="auto") - Notebooks
- Google Colab
- Kaggle
metadata
license: cc-by-nc-4.0
language: en
tags:
- vision
- image-feature-extraction
- sar
- remote-sensing
- synthetic-aperture-radar
- masked-autoencoder
- model-hub
library_name: transformers
pipeline_tag: image-feature-extraction
datasets:
- Wenquandan777/SAR-1M
arxiv: 2512.16635
SARMAE Transformers Checkpoints
Official Hugging Face Transformers-format releases of SARMAE ViT encoders, converted for native transformers inference with trust_remote_code=True.
| Resource | Link |
|---|---|
| Paper | 2512.16635 |
| Training dataset | Wenquandan777/SAR-1M |
| Legacy PyTorch weights | Wenquandan777/SARMAE |
| Source code | GitHub |
Available checkpoints
| Variant | Backbone | Stage | Hidden | Layers | Heads | Input |
|---|---|---|---|---|---|---|
| sarmae-vit-base-patch16-pretrain | ViT-B | pretrain | 768 | 12 | 12 | 224 |
| sarmae-vit-large-patch16-pretrain | ViT-L | pretrain | 1024 | 24 | 16 | 224 |
Installation
pip install transformers timm torch torchvision safetensors huggingface_hub
Usage
Point transformers.pipeline or AutoModel.from_pretrained at a variant subfolder:
from transformers import pipeline
pipe = pipeline(
task="image-feature-extraction",
model="BiliSakura/SARMAE-transformers",
revision="main",
trust_remote_code=True,
model_kwargs={"subfolder": "vit-base-patch16-pretrain"},
)
features = pipe(sar_image, pool=True, return_tensors=True)
Or load a variant directly:
from transformers import AutoModel
model = AutoModel.from_pretrained(
"BiliSakura/SARMAE-transformers",
subfolder="vit-base-patch16-pretrain",
trust_remote_code=True,
)
Each variant folder is a self-contained model repository with:
config.json(auto_map,custom_pipelines)model.safetensorspreprocessor_config.jsonmodeling_sarmae.py,image_processing_sarmae.py,pipeline_sarmae.py
Convert legacy checkpoints locally
python scripts/convert_checkpoint.py models/SARMAE_vitb_checkpoint-last
python scripts/convert_checkpoint.py models/SARMAE_vitl_checkpoint-last
Upload to this Hub repo
python scripts/upload_to_hub.py models/sarmae-vit-base-patch16-pretrain \
--path-in-repo vit-base-patch16-pretrain
python scripts/upload_to_hub.py models/sarmae-vit-large-patch16-pretrain \
--path-in-repo vit-large-patch16-pretrain
python scripts/upload_to_hub.py --hub-readme-only
Citation
@misc{liu2025sarmaemaskedautoencodersar,
title={SARMAE: Masked Autoencoder for SAR Representation Learning},
author={Danxu Liu and Di Wang and Hebaixu Wang and Haoyang Chen and Wentao Jiang and Yilin Cheng and Haonan Guo and Wei Cui and Jing Zhang},
year={2025},
eprint={2512.16635},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2512.16635},
}