NVIDIA Dynamo

Distributed LLM inference with KV cache-aware routing and disaggregated prefill/decode on HyperPod EKS

View on GitHub

Overview

NVIDIA Dynamo is a distributed inference framework providing KV cache-aware routing, disaggregated prefill/decode, and NIXL-based KV transfer for LLM serving on Kubernetes. This test case serves models on SageMaker HyperPod EKS with the SGLang backend.

Scenarios

ScenarioModelPatternGPUs
gpt-oss-aggGPT-OSS-20BAggregated (1 worker = prefill+decode)1
gpt-oss-disaggGPT-OSS-20BDisaggregated (prefill + decode, NIXL)2
qwen3.6-aggQwen3.6-27B-FP8Aggregated1
qwen3.6-disaggQwen3.6-27B-FP8Disaggregated (prefill + decode, NIXL)2

Key Features

  • KV cache-aware routing โ€” Routes requests to workers with cached prefixes
  • Disaggregated prefill/decode โ€” Separate workers for compute-heavy prefill and latency-sensitive decode
  • NIXL-based KV transfer โ€” Efficient GPU-to-GPU KV cache migration
  • DynamoGraphDeployment (DGD) CRD โ€” Kubernetes-native operator