Image-to-Text
Transformers
Safetensors
English
vlm
text-generation
image-captioning
visual-question-answering
Instructions to use 4bit/uform-gen with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use 4bit/uform-gen with Transformers:
# Use a pipeline as a high-level helper # Warning: Pipeline type "image-to-text" is no longer supported in transformers v5. # You must load the model directly (see below) or downgrade to v4.x with: # 'pip install "transformers<5.0.0' from transformers import pipeline pipe = pipeline("image-to-text", model="4bit/uform-gen", device_map="auto")# Load model directly from transformers import AutoModelForCausalLM model = AutoModelForCausalLM.from_pretrained("4bit/uform-gen", dtype="auto", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "_name_or_path": "uform-gen", | |
| "architectures": [ | |
| "VLMForCausalLM" | |
| ], | |
| "center_crop": true, | |
| "image_encoder_embedding_dim": 256, | |
| "image_encoder_hidden_size": 768, | |
| "image_encoder_num_heads": 12, | |
| "image_encoder_num_layers": 12, | |
| "image_encoder_patch_size": 16, | |
| "image_encoder_pooling": "cls", | |
| "image_pooler_intermediate_size": 5504, | |
| "image_pooler_num_attn_heads": 16, | |
| "image_pooler_num_latents": 196, | |
| "image_size": 224, | |
| "image_token_id": 32002, | |
| "initializer_range": 0.02, | |
| "model_type": "vlm", | |
| "text_decoder_name_or_path": "princeton-nlp/Sheared-LLaMA-1.3B", | |
| "tokenizer_name_or_path": "unum-cloud/uform-gen", | |
| "torch_dtype": "float32", | |
| "transformers_version": "4.36.2", | |
| "use_cache": true | |
| } | |