fix: retire one reasoning-predictor replica, give freed V100 to survivor via TP=2

This commit is contained in:
Story Crater Bot
2026-08-21 11:34:03 -07:00
parent c956ac1465
commit 65f3f25932
+5 -5
View File
@@ -28,7 +28,7 @@ spec:
- --quantization=bitsandbytes - --quantization=bitsandbytes
- --dtype=float16 - --dtype=float16
- --kv-cache-dtype=auto - --kv-cache-dtype=auto
- --tensor-parallel-size=1 - --tensor-parallel-size=2
- --max-model-len=16384 - --max-model-len=16384
- --gpu-memory-utilization=0.90 - --gpu-memory-utilization=0.90
- --max-num-seqs=4 - --max-num-seqs=4
@@ -85,11 +85,11 @@ spec:
limits: limits:
cpu: '16' cpu: '16'
memory: 36Gi memory: 36Gi
nvidia.com/gpu: '1' nvidia.com/gpu: '2'
requests: requests:
cpu: '8' cpu: '8'
memory: 12Gi memory: 12Gi
nvidia.com/gpu: '1' nvidia.com/gpu: '2'
startupProbe: startupProbe:
failureThreshold: 80 failureThreshold: 80
httpGet: httpGet:
@@ -103,8 +103,8 @@ spec:
name: shm name: shm
deploymentStrategy: deploymentStrategy:
type: Recreate type: Recreate
maxReplicas: 2 maxReplicas: 1
minReplicas: 2 minReplicas: 1
nodeSelector: nodeSelector:
kubernetes.io/hostname: worker-1 kubernetes.io/hostname: worker-1
runtimeClassName: nvidia runtimeClassName: nvidia