Video-Text-to-Text
Transformers
Safetensors
English
audiovisualflamingo
text-generation
audio
video
image
audio-visual
multimodal
reasoning
video understanding
long-video
audio understanding
ASR
timestamp-grounding
instruction-tuned
dynamic-s2
CRTE
TAVIT
Instructions to use nvidia/nemotron-labs-audio-visual-flamingo-hf with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use nvidia/nemotron-labs-audio-visual-flamingo-hf with Transformers:
# Load model directly from transformers import AutoModelForSeq2SeqLM model = AutoModelForSeq2SeqLM.from_pretrained("nvidia/nemotron-labs-audio-visual-flamingo-hf", device_map="auto") - Notebooks
- Google Colab
- Kaggle

- Xet hash:
- 4f0f0b09edb4a022cb273e39bf715e44f802a70c715bfcfc3d1ac6316186d0fc
- Size of remote file:
- 273 kB
- SHA256:
- 3e18f3a9d5250347a63dc6b3d5b090d34f55d901be827b0416fb93119b37e14f
·
Xet efficiently stores Large Files inside Git, intelligently splitting files into unique chunks and accelerating uploads and downloads. More info.