Video-Text-to-Text
Transformers
Safetensors
English
audiovisualflamingo
text-generation
audio
video
image
audio-visual
multimodal
reasoning
video understanding
long-video
audio understanding
ASR
timestamp-grounding
instruction-tuned
dynamic-s2
CRTE
TAVIT
Instructions to use nvidia/nemotron-labs-audio-visual-flamingo-hf with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use nvidia/nemotron-labs-audio-visual-flamingo-hf with Transformers:
# Load model directly from transformers import AutoModelForSeq2SeqLM model = AutoModelForSeq2SeqLM.from_pretrained("nvidia/nemotron-labs-audio-visual-flamingo-hf", device_map="auto") - Notebooks
- Google Colab
- Kaggle

- Xet hash:
- 1a2e6e26091642ec64babea35aaeaf5f37e67c09baa6f2efa80d8daffb84b043
- Size of remote file:
- 302 kB
- SHA256:
- bd871ff01f20203347184e246d6fb4f2eacc1f88d3c2f276990502105ab4701d
·
Xet efficiently stores Large Files inside Git, intelligently splitting files into unique chunks and accelerating uploads and downloads. More info.