Burst of requests → Qwen3.5-27B
Baseline · one model per GPU
served 0 · shed 0
OpenInfer · every model on every GPU
served 0 · shed 0
Same GPUs, same burst. Pinning saturates one GPU and sheds; pooling spreads the burst across four and serves it all.