DGX Spark OEM 듀얼노드로 실행 가능할까요?
MSI EdgeXpert를 2대 연결해서 사용 중입니다.
공개된 것 보고 사용해보고 싶어서 가중치를 내려받으려고 하긴하는데,
DGX Spark 2대에서 구동 가능한지 감이 안옵니다.
이론상 가능할 것 같은데 레시피가 없으면 가능한지 모르겠어서요.
160GB VRAM으로 테스트 해보아서 DGX Spark x 2면 이론상 가능할 것 같습니다.
저희 내부에서 빠르게 확인해서 금일 중 리드미로 업데이트 드리겠습니다.
@Rubrigate 저희 내부에서 금일 확인한 결과 아래와 같이 실행하여 Spark 2대 직결하여 구동되는 것을 확인했습니다.
GPU_UTIL="${GPU_UTIL:-0.80}"
MAXLEN="${MAXLEN:-4096}"
MAXSEQS="${MAXSEQS:-8}"
MAXTOK="${MAXTOK:-2048}"
EAGER="${EAGER:---enforce-eager}"
MOE_BACKEND="${MOE_BACKEND:-flashinfer_b12x}"
vllm serve nota-ai/Solar-Open2-250B-Nota-NVFP4
--served-model-name solar-open2-250b
--tensor-parallel-size 2 --distributed-executor-backend ray
--gpu-memory-utilization "$GPU_UTIL" --max-model-len "$MAXLEN"
--max-num-seqs "$MAXSEQS" --max-num-batched-tokens "$MAXTOK" $EAGER --moe-backend "$MOE_BACKEND"
--default-chat-template-kwargs "{"think_render_option":"preserved"}"
--reasoning-parser solar_open2 --tool-call-parser solar_open2 --enable-auto-tool-choice
--logits-processors vllm.v1.sample.logits_processor.solar_open2:SolarOpen2TemplateLogitsProcessor \
길이와 관련된 인자들은 상황에 맞추어서 설정해주시면 됩니다. 하나의 예시로 봐주시면 좋을 것 같습니다.
가장 중요한 부분은 현재 vllm이 MoE flashinfer 지원문제로 MoE Backend만 위와같이 설정해주시면 정상 작동됩니다.
감사합니다.
감사합니다. 테스트해보겠습니다.