Skip to content

A practical guide to running 8x RTX PRO 6000's

Maximize parallelism across 8x RTX PRO 6000's: high-concurrency inference, model fleets, and 70B fine-tuning.

By Jerry James ·

NVIDIA RTX PRO 6000 Blackwell Server Edition: a gold passive blower card angled across a black backdrop, NVIDIA logo on the shroud.
  • RTX PRO 6000 Blackwell
  • EPYC 9555
  • tensor parallelism
  • TP=1
  • DP=8
  • PCIe Gen 5
  • NVLink
  • KV cache
  • FP8
  • GDDR7
  • vLLM
  • FSDP
  • DeepSpeed ZeRO-3
  • QLoRA
  • RLHF
  • DPO
  • Qwen3.8-27B
  • Llama-3.3 70B
  • NCCL
  • Zen 5
  • multi-GPU inference
  • self-hosted LLM