fix dp router

Signed-off-by: inkcherry <mingzhi.liu@amd.com>
2026-07-03 19:17:12 +08:00 · 2025-11-19 08:35:28 +00:00 · 2025-11-19 08:35:28 +00:00 · 675943e018
commit 675943e018
parent a7ea23d16d
2 changed files with 3 additions and 0 deletions
--- a/vllm/entrypoints/openai/serving_completion.py
+++ b/vllm/entrypoints/openai/serving_completion.py
@ -225,6 +225,7 @@ class OpenAIServingCompletion(OpenAIServing):
                        lora_request=lora_request,
                        trace_headers=trace_headers,
                        priority=request.priority,
+                        data_parallel_rank=data_parallel_rank,
                    )

                    generator = self.engine_client.generate(
--- a/vllm/entrypoints/openai/serving_engine.py
+++ b/vllm/entrypoints/openai/serving_engine.py
@ -1172,6 +1172,7 @@ class OpenAIServing:
        lora_request: LoRARequest | None,
        trace_headers: Mapping[str, str] | None,
        priority: int,
+        data_parallel_rank: int,
    ) -> tuple[EngineCoreRequest, dict[str, Any]]:
        """Use the Processor to process inputs for AsyncLLM."""
        tokenization_kwargs: dict[str, Any] = {}
@ -1187,6 +1188,7 @@ class OpenAIServing:
            tokenization_kwargs=tokenization_kwargs,
            trace_headers=trace_headers,
            priority=priority,
+            data_parallel_rank=data_parallel_rank,
        )
        return engine_request, tokenization_kwargs