DGX Spark OEM 듀얼노드로 실행 가능할까요?

#1
by Rubrigate - opened

MSI EdgeXpert를 2대 연결해서 사용 중입니다.

공개된 것 보고 사용해보고 싶어서 가중치를 내려받으려고 하긴하는데,

DGX Spark 2대에서 구동 가능한지 감이 안옵니다.

이론상 가능할 것 같은데 레시피가 없으면 가능한지 모르겠어서요.

160GB VRAM으로 테스트 해보아서 DGX Spark x 2면 이론상 가능할 것 같습니다.
저희 내부에서 빠르게 확인해서 금일 중 리드미로 업데이트 드리겠습니다.

Nota AI org

@Rubrigate 저희 내부에서 금일 확인한 결과 아래와 같이 실행하여 Spark 2대 직결하여 구동되는 것을 확인했습니다.

GPU_UTIL="${GPU_UTIL:-0.80}"
MAXLEN="${MAXLEN:-4096}"
MAXSEQS="${MAXSEQS:-8}"
MAXTOK="${MAXTOK:-2048}"
EAGER="${EAGER:---enforce-eager}"
MOE_BACKEND="${MOE_BACKEND:-flashinfer_b12x}"

vllm serve nota-ai/Solar-Open2-250B-Nota-NVFP4
--served-model-name solar-open2-250b
--tensor-parallel-size 2 --distributed-executor-backend ray
--gpu-memory-utilization "$GPU_UTIL" --max-model-len "$MAXLEN"
--max-num-seqs "$MAXSEQS" --max-num-batched-tokens "$MAXTOK" $EAGER --moe-backend "$MOE_BACKEND"
--default-chat-template-kwargs "{"think_render_option":"preserved"}"
--reasoning-parser solar_open2 --tool-call-parser solar_open2 --enable-auto-tool-choice
--logits-processors vllm.v1.sample.logits_processor.solar_open2:SolarOpen2TemplateLogitsProcessor \

길이와 관련된 인자들은 상황에 맞추어서 설정해주시면 됩니다. 하나의 예시로 봐주시면 좋을 것 같습니다.
가장 중요한 부분은 현재 vllm이 MoE flashinfer 지원문제로 MoE Backend만 위와같이 설정해주시면 정상 작동됩니다.

감사합니다.

hancheolp changed discussion status to closed
hancheolp changed discussion status to open

감사합니다. 테스트해보겠습니다.

hancheolp changed discussion status to closed

Sign up or log in to comment