atharvda commited on
Commit
b8c273e
·
verified ·
1 Parent(s): 9f1eaf6

Upload folder using huggingface_hub

Browse files
Files changed (2) hide show
  1. Dockerfile +1 -1
  2. app.py +4 -3
Dockerfile CHANGED
@@ -8,7 +8,7 @@ ENV HF_HOME=/tmp/hf \
8
  WORKDIR /app
9
 
10
  RUN pip install --no-cache-dir \
11
- "transformers>=4.52" \
12
  accelerate \
13
  "bitsandbytes>=0.43" \
14
  sentencepiece \
 
8
  WORKDIR /app
9
 
10
  RUN pip install --no-cache-dir \
11
+ "transformers>=5.13" \
12
  accelerate \
13
  "bitsandbytes>=0.43" \
14
  sentencepiece \
app.py CHANGED
@@ -18,7 +18,7 @@ from fastapi import FastAPI, Request
18
  from fastapi.responses import JSONResponse
19
  from PIL import Image
20
 
21
- MODEL_ID = os.environ.get("MODEL_ID", "llmfan46/gemma-3-12b-it-ultra-uncensored-heretic")
22
 
23
  app = FastAPI()
24
  _proc = None
@@ -32,7 +32,8 @@ def _load():
32
  if _model is not None or _load_error is not None:
33
  return
34
  try:
35
- from transformers import AutoProcessor, BitsAndBytesConfig, Gemma3ForConditionalGeneration
 
36
  _proc = AutoProcessor.from_pretrained(MODEL_ID)
37
  bnb = BitsAndBytesConfig(
38
  load_in_4bit=True,
@@ -40,7 +41,7 @@ def _load():
40
  bnb_4bit_compute_dtype=torch.float16, # T4 has no bf16
41
  bnb_4bit_use_double_quant=True,
42
  )
43
- _model = Gemma3ForConditionalGeneration.from_pretrained(
44
  MODEL_ID, quantization_config=bnb, device_map="auto", torch_dtype=torch.float16,
45
  )
46
  _model.eval()
 
18
  from fastapi.responses import JSONResponse
19
  from PIL import Image
20
 
21
+ MODEL_ID = os.environ.get("MODEL_ID", "llmfan46/gemma-4-E4B-it-ultra-uncensored-heretic")
22
 
23
  app = FastAPI()
24
  _proc = None
 
32
  if _model is not None or _load_error is not None:
33
  return
34
  try:
35
+ # model-agnostic loader works for gemma3 AND gemma4 (needs transformers>=5.13)
36
+ from transformers import AutoModelForImageTextToText, AutoProcessor, BitsAndBytesConfig
37
  _proc = AutoProcessor.from_pretrained(MODEL_ID)
38
  bnb = BitsAndBytesConfig(
39
  load_in_4bit=True,
 
41
  bnb_4bit_compute_dtype=torch.float16, # T4 has no bf16
42
  bnb_4bit_use_double_quant=True,
43
  )
44
+ _model = AutoModelForImageTextToText.from_pretrained(
45
  MODEL_ID, quantization_config=bnb, device_map="auto", torch_dtype=torch.float16,
46
  )
47
  _model.eval()