From cfd5a96331174d5f9ed8eb8ab203d8a62dd4fae0 Mon Sep 17 00:00:00 2001 From: Story Crater Bot <19826264+Riotpiaole@users.noreply.github.com> Date: Fri, 21 Aug 2026 16:23:07 -0700 Subject: [PATCH] fix: retire one reasoning-predictor replica, run PP=2 across both V100s (Qwen3.5 MoE swap abandoned, moving to Ollama) --- k8s/apps/llm-serving/reasoning.yaml | 9 +++++---- 1 file changed, 5 insertions(+), 4 deletions(-) diff --git a/k8s/apps/llm-serving/reasoning.yaml b/k8s/apps/llm-serving/reasoning.yaml index 18ffdf1..19aae96 100644 --- a/k8s/apps/llm-serving/reasoning.yaml +++ b/k8s/apps/llm-serving/reasoning.yaml @@ -29,6 +29,7 @@ spec: - --dtype=float16 - --kv-cache-dtype=auto - --tensor-parallel-size=1 + - --pipeline-parallel-size=2 - --max-model-len=16384 - --gpu-memory-utilization=0.90 - --max-num-seqs=4 @@ -85,11 +86,11 @@ spec: limits: cpu: '16' memory: 36Gi - nvidia.com/gpu: '1' + nvidia.com/gpu: '2' requests: cpu: '8' memory: 12Gi - nvidia.com/gpu: '1' + nvidia.com/gpu: '2' startupProbe: failureThreshold: 80 httpGet: @@ -103,8 +104,8 @@ spec: name: shm deploymentStrategy: type: Recreate - maxReplicas: 2 - minReplicas: 2 + maxReplicas: 1 + minReplicas: 1 nodeSelector: kubernetes.io/hostname: worker-1 runtimeClassName: nvidia