#!/bin/sh - SCRIPT_DIR="$(cd "$(dirname "$0")" && pwd)" MODEL_DIR="$(dirname "$SCRIPT_DIR")" . ~/venv/vllm/bin/activate dockless destroy seeker-inference sleep 5 dockless run -d --name seeker-inference \ -e CUDA_HOME=/usr/local/cuda-13.0 \ -e C_INCLUDE_PATH=/usr/local/cuda-13.0/include \ -e LIBRARY_PATH=/usr/lib/aarch64-linux-gnu/nvidia \ -e FLASHINFER_NVCC=/usr/local/cuda-13.0/bin/nvcc \ -e VLLM_USE_FLASHINFER_MOE_FP4=0 "$SCRIPT_DIR/unglitched_vllm" \ --served-model-name Nikola \ --port 9000 \ --enable-auto-tool-choice \ --tool-call-parser minimax_m2 \ --reasoning-parser minimax_m2_optthink \ --reasoning-parser-plugin "$SCRIPT_DIR/minimax_m2_optthink_reasoning_parser.py" \ --enable-prefix-caching \ --max-num-seqs 4 --cudagraph-capture-sizes 1 2 4 --max-model-len auto \ --max_num_batched_tokens 8192 \ --gpu-memory-utilization 0.95 \ --attention-backend FLASHINFER \ --async-scheduling \ --enable-chunked-prefill \ --chat-template "$SCRIPT_DIR/chat_template.jinja" \ --model "${@:-$MODEL_DIR}"