# ── Core ML ────────────────────────────────────────────────── torch>=2.4.0 torchvision # ── Transformers ───────────────────────────────────────────── transformers>=5.1.0 # v5 = AutoModelForImageTextToText (Vision2Seq renamed) accelerate>=1.1.0 # transformers v5 requires >=1.1.0 # ── Quantization & Adapters ────────────────────────────────── bitsandbytes>=0.46.1 # ✅ UPGRADE: v5 requires >=0.46.1 (was 0.43.0) peft>=0.18.0 # ✅ UPGRADE: v5 requires >=0.18.0 (adapter_config has 0.18.1) # ── Model Format ───────────────────────────────────────────── safetensors>=0.4.0 # ── Qwen VL Utilities ──────────────────────────────────────── qwen-vl-utils # ── Gradio ─────────────────────────────────────────────────── gradio # ── Image Processing ───────────────────────────────────────── Pillow>=10.0.0 numpy opencv-python-headless # ── Tokenizer Dependencies ─────────────────────────────────── sentencepiece protobuf # ── HuggingFace Integration ─────────────────────────────────── huggingface_hub>=1.0.0 # ✅ v5 requires >=1.0.0 spaces hf_xet # ── Misc ───────────────────────────────────────────────────── requests