[https://nvbugs/6480621][test] Revert to 60-second KV transfer timeout for GB300 DeepSeek V4 Pro disaggregated perf-sanity - #17137
Conversation
|
/bot run --disable-fail-fast --stage-list "GB300-44_GPUs-11_Nodes-PyTorch-Disagg-PerfSanity-CTX3-NODE1-GPU4-GEN1-NODE8-GPU32-Post-Merge-2" |
|
/bot run --disable-fail-fast --disable-reuse-test --stage-list "GB300-44_GPUs-11_Nodes-PyTorch-Disagg-PerfSanity-CTX3-NODE1-GPU4-GEN1-NODE8-GPU32-Post-Merge-2" |
|
PR_Github #63105 [ run ] triggered by Bot. Commit: |
|
PR_Github #63106 [ run ] triggered by Bot. Commit: |
|
PR_Github #63105 [ run ] completed with state |
|
PR_Github #63106 [ run ] completed with state |
|
/bot run --disable-fail-fast --disable-reuse-test --stage-list "GB300-44_GPUs-11_Nodes-PyTorch-Disagg-PerfSanity-CTX3-NODE1-GPU4-GEN1-NODE8-GPU32-Post-Merge-1" |
|
PR_Github #63144 [ run ] triggered by Bot. Commit: |
|
PR_Github #63144 [ run ] completed with state
|
|
/bot run --disable-fail-fast --disable-reuse-test --stage-list "GB300-44_GPUs-11_Nodes-PyTorch-Disagg-PerfSanity-CTX3-NODE1-GPU4-GEN1-NODE8-GPU32-Post-Merge-1" |
|
PR_Github #63150 [ run ] triggered by Bot. Commit: |
|
PR_Github #63150 [ run ] completed with state
|
|
/bot run --disable-fail-fast --disable-reuse-test --stage-list "GB300-44_GPUs-11_Nodes-PyTorch-Disagg-PerfSanity-CTX3-NODE1-GPU4-GEN1-NODE8-GPU32-Post-Merge-1" |
|
PR_Github #63165 [ run ] triggered by Bot. Commit: |
|
PR_Github #63165 [ run ] completed with state
|
38ca970 to
3e6c120
Compare
|
/bot run --disable-fail-fast --disable-reuse-test --stage-list "GB300-44_GPUs-11_Nodes-PyTorch-Disagg-PerfSanity-CTX3-NODE1-GPU4-GEN1-NODE8-GPU32-Post-Merge-1" |
|
PR_Github #63555 [ run ] triggered by Bot. Commit: |
|
PR_Github #63555 [ run ] completed with state
|
3e6c120 to
b7bd98a
Compare
|
/bot run --disable-fail-fast --disable-reuse-test --stage-list "GB300-44_GPUs-11_Nodes-PyTorch-Disagg-PerfSanity-CTX3-NODE1-GPU4-GEN1-NODE8-GPU32-Post-Merge-2" |
|
PR_Github #63564 [ run ] triggered by Bot. Commit: |
|
PR_Github #63564 [ run ] completed with state |
6573ef3 to
f66c303
Compare
|
/bot run --disable-fail-fast |
|
PR_Github #69490 [ run ] triggered by Bot. Commit: |
|
PR_Github #69490 [ run ] completed with state
|
f66c303 to
6b5d69c
Compare
|
/bot run --disable-fail-fast --disable-reuse-test --stage-list "GB300-44_GPUs-11_Nodes-PyTorch-Disagg-PerfSanity-CTX3-NODE1-GPU4-GEN1-NODE8-GPU32-Post-Merge-2" |
|
PR_Github #69539 [ run ] triggered by Bot. Commit: |
|
PR_Github #69539 [ run ] completed with state
|
mikeiovine
left a comment
There was a problem hiding this comment.
Stamp on behalf of runtime-devs, delegating review to @NVIDIA/trt-llm-torch-attention-devs
6b5d69c to
a4293f2
Compare
|
/bot run --disable-fail-fast --disable-reuse-test --only-multi-gpu-test --stage-list "GB300-44_GPUs-11_Nodes-PyTorch-Disagg-PerfSanity-CTX3-NODE1-GPU4-GEN1-NODE8-GPU32-Post-Merge-2" |
|
PR_Github #69570 [ run ] triggered by Bot. Commit: |
|
PR_Github #69570 [ run ] completed with state |
|
/bot run --disable-fail-fast |
|
PR_Github #69783 [ run ] triggered by Bot. Commit: |
|
PR_Github #69783 [ run ] completed with state
|
Signed-off-by: Chien-Chun Hung <2679986+chienchunhung@users.noreply.github.com>
a4293f2 to
ea57698
Compare
|
/bot run --disable-fail-fast |
|
PR_Github #69820 [ run ] triggered by Bot. Commit: |
|
PR_Github #69820 [ run ] completed with state
|
|
/bot run --disable-fail-fast |
|
PR_Github #70010 [ run ] triggered by Bot. Commit: |
|
PR_Github #70010 [ run ] completed with state |
Summary
This PR updates one GB300 DeepSeek V4 Pro disaggregated perf-sanity target:
cache_transceiver_precheck;kv_transfer_timeout_msfrom 600000 ms to 60000 ms;PRs #17223 and #18185 have merged into
main. The current PR heada4293f296272d202ffad8ebcbd4953066b377580is rebased directly onmainat36138a2c8e0350d5f23bba41c1c12962a187009b. Merged #18185 supplies the DeepSeek V4 EPLB weight-loading OOM fix and removes this target's waiver.Validation
Current-head targeted validation: PASSED
Command:
/bot run --disable-fail-fast --disable-reuse-test --only-multi-gpu-test --stage-list "GB300-44_GPUs-11_Nodes-PyTorch-Disagg-PerfSanity-CTX3-NODE1-GPU4-GEN1-NODE8-GPU32-Post-Merge-2"Exact test:
perf/test_perf_sanity.py::test_e2e[disagg_upload-gen_only-gb300_deepseek-v4-pro-fp4_8k1k_con180_ctx3_dep4_gen1_dep32_eplb384_mtp3_ccb-NIXL]Evidence:
a4293f296with test reuse disabled.3325958completed with exit code0:0acrossnvl72d217-T[01-11].This validates the current #17223 + #18185 + #17137 combination for the 11-node/44-GPU, 3-CTX, concurrency-180 CI proxy. It does not replace rerunning the original 8P1D, concurrency-1760 AgentPerf workload reported in NVBUG #6480621.
Related PRs