MiniMax-M2.7-REAP-172B-A10B-NVFP4 / extras /inference_minimax.sh
catplusplus's picture
Upload folder using huggingface_hub
2143e89 verified
Raw
History Blame Contribute Delete
1.05 kB
#!/bin/sh -
SCRIPT_DIR="$(cd "$(dirname "$0")" && pwd)"
MODEL_DIR="$(dirname "$SCRIPT_DIR")"
. ~/venv/vllm/bin/activate
dockless destroy seeker-inference
sleep 5
dockless run -d --name seeker-inference \
-e CUDA_HOME=/usr/local/cuda-13.0 \
-e C_INCLUDE_PATH=/usr/local/cuda-13.0/include \
-e LIBRARY_PATH=/usr/lib/aarch64-linux-gnu/nvidia \
-e FLASHINFER_NVCC=/usr/local/cuda-13.0/bin/nvcc \
-e VLLM_USE_FLASHINFER_MOE_FP4=0 "$SCRIPT_DIR/unglitched_vllm" \
--served-model-name Nikola \
--port 9000 \
--enable-auto-tool-choice \
--tool-call-parser minimax_m2 \
--reasoning-parser minimax_m2_optthink \
--reasoning-parser-plugin "$SCRIPT_DIR/minimax_m2_optthink_reasoning_parser.py" \
--enable-prefix-caching \
--max-num-seqs 4 --cudagraph-capture-sizes 1 2 4 --max-model-len auto \
--max_num_batched_tokens 8192 \
--gpu-memory-utilization 0.95 \
--attention-backend FLASHINFER \
--async-scheduling \
--enable-chunked-prefill \
--chat-template "$SCRIPT_DIR/chat_template.jinja" \
--model "${@:-$MODEL_DIR}"