From 7a149bfb48bf5ad2351b09305d13c27c38c583c0 Mon Sep 17 00:00:00 2001 From: Story Crater Bot <19826264+Riotpiaole@users.noreply.github.com> Date: Fri, 21 Aug 2026 13:21:41 -0700 Subject: [PATCH] fix: use pipeline parallelism instead of TP for reasoning-predictor (bnb prequant blocks TP) --- k8s/apps/llm-serving/reasoning.yaml | 3 ++- 1 file changed, 2 insertions(+), 1 deletion(-) diff --git a/k8s/apps/llm-serving/reasoning.yaml b/k8s/apps/llm-serving/reasoning.yaml index 0dd677c..19aae96 100644 --- a/k8s/apps/llm-serving/reasoning.yaml +++ b/k8s/apps/llm-serving/reasoning.yaml @@ -28,7 +28,8 @@ spec: - --quantization=bitsandbytes - --dtype=float16 - --kv-cache-dtype=auto - - --tensor-parallel-size=2 + - --tensor-parallel-size=1 + - --pipeline-parallel-size=2 - --max-model-len=16384 - --gpu-memory-utilization=0.90 - --max-num-seqs=4