diff --git a/tests/integration/defs/.test_durations b/tests/integration/defs/.test_durations index 5dbb75d922a7..bb0f8163487f 100644 --- a/tests/integration/defs/.test_durations +++ b/tests/integration/defs/.test_durations @@ -1,7 +1,6 @@ { "accuracy/test_disaggregated_serving.py::TestDeepSeekR1::test_kv_cache_v2_nixl_python[cache_mgr_v1]": 563.5671428571428, "accuracy/test_disaggregated_serving.py::TestDeepSeekV32Exp::test_auto_dtype[False]": 577.3825454545454, - "accuracy/test_disaggregated_serving.py::TestDeepSeekV32Exp::test_kv_cache_v2_nixl_python[cache_mgr_v1]": 762.6861428571428, "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_auto_dtype[mtp_nextn=0-overlap_scheduler=False]": 248.946875, "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_auto_dtype[mtp_nextn=0-overlap_scheduler=True]": 155.819, "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_auto_dtype[mtp_nextn=2-overlap_scheduler=False]": 226.137625, @@ -10,13 +9,10 @@ "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_gen_first[adp-mtp2]": 309.67263636363634, "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_gen_first[noadp-mtp0]": 459.758, "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_gen_only_spec_dec": 174.414125, - "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_gen_only_sync[python]": 261.8368118811881, "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_guided_decoding[llguidance-mtp_nextn=0]": 164.20842857142858, "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_guided_decoding[llguidance-mtp_nextn=2]": 373.866, "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_guided_decoding[xgrammar-mtp_nextn=0]": 141.08328571428572, "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_guided_decoding[xgrammar-mtp_nextn=2]": 176.04781981981984, - "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_kv_cache_v2_nixl_python": 283.61367924528304, - "accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_nixl_backend": 256.39867676767676, "accuracy/test_disaggregated_serving.py::TestDeepSeekV4Flash::test_auto_dtype": 653.3680224719101, "accuracy/test_disaggregated_serving.py::TestGLM52NVFP4::test_nvfp4_nixl_python[cache_mgr_v1]": 1014.7549897959184, "accuracy/test_disaggregated_serving.py::TestGPTOSS::test_kv_cache_v2_nixl_python[cache_mgr_v1]": 337.72714285714284, @@ -650,7 +646,6 @@ "disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_bf16_empty_batch[DeepSeek-V3-Lite-bf16]": 190.4600707070707, "disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_attention_dp[DeepSeek-V3-Lite-fp8]": 128.8671616161616, "disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_nixl[DeepSeek-V3-Lite-fp8]": 121.09470707070707, - "disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_transceiver_runtime_python[DeepSeek-V3-Lite-fp8]": 118.99839393939394, "disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_ucx[DeepSeek-V3-Lite-fp8]": 99.04030303030302, "disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_ucx_tp1_single_gpu[DeepSeek-V3-Lite-fp8]": 136.5389226006192, "disaggregated/test_disaggregated.py::test_disaggregated_diff_max_tokens[TinyLlama-1.1B-Chat-v1.0]": 72.53091237113402, diff --git a/tests/integration/defs/accuracy/test_disaggregated_serving.py b/tests/integration/defs/accuracy/test_disaggregated_serving.py index 806d706cd5f1..575863d38cbb 100644 --- a/tests/integration/defs/accuracy/test_disaggregated_serving.py +++ b/tests/integration/defs/accuracy/test_disaggregated_serving.py @@ -1044,54 +1044,17 @@ class TestDeepSeekV3Lite(LlmapiAccuracyTestHarness): @pytest.mark.skip_less_device(2) @pytest.mark.skip_less_device_memory(60000) @skip_no_hopper - def test_nixl_backend(self): - ctx_server_config = { - "disable_overlap_scheduler": True, - "cache_transceiver_config": { - "backend": "NIXL", - "max_tokens_in_buffer": 4096 - } - } - gen_server_config = { - "disable_overlap_scheduler": True, - "cache_transceiver_config": { - "backend": "NIXL", - "max_tokens_in_buffer": 4096 - } - } - disaggregated_server_config = { - "hostname": "localhost", - "backend": "pytorch", - "context_servers": { - "num_instances": 1 - }, - "generation_servers": { - "num_instances": 1 - } - } - with launch_disaggregated_llm(disaggregated_server_config, - ctx_server_config, gen_server_config, - self.MODEL_PATH) as llm: - run_accuracy_test(llm, self.MODEL_NAME, ["MMLU", "GSM8K"]) - - @pytest.mark.skip_less_device(2) - @pytest.mark.skip_less_device_memory(60000) - @skip_no_hopper - @pytest.mark.parametrize("transceiver_runtime", ["PYTHON", "CPP"], - ids=["python", "cpp"]) - def test_gen_only_sync(self, transceiver_runtime): - """Test gen-only synchronous KV transfer with each NIXL runtime. + def test_gen_only_sync(self): + """Test gen-only synchronous KV transfer with PYTHON NIXL runtime. Sets TRTLLM_DISABLE_KV_CACHE_TRANSFER_OVERLAP=1 so the gen worker calls - the blocking request_and_receive_sync path. The C++ variant uses a - bounded client timeout so a stuck transfer fails this test instead of - waiting for its outer one-hour timeout. + the blocking request_and_receive_sync path. """ ctx_server_config = { "disable_overlap_scheduler": True, "cache_transceiver_config": { "backend": "NIXL", - "transceiver_runtime": transceiver_runtime, + "transceiver_runtime": "PYTHON", "max_tokens_in_buffer": 4096, }, } @@ -1099,7 +1062,7 @@ def test_gen_only_sync(self, transceiver_runtime): "disable_overlap_scheduler": True, "cache_transceiver_config": { "backend": "NIXL", - "transceiver_runtime": transceiver_runtime, + "transceiver_runtime": "PYTHON", "max_tokens_in_buffer": 4096, }, } @@ -1120,10 +1083,8 @@ def test_gen_only_sync(self, transceiver_runtime): self.MODEL_PATH, # Apply to both servers: gen worker uses sync receive path. extra_env={"TRTLLM_DISABLE_KV_CACHE_TRANSFER_OVERLAP": "1"}, - request_timeout_s=(120 if transceiver_runtime == "CPP" else - DEFAULT_REQUEST_TIMEOUT_S), - request_max_retries=(0 - if transceiver_runtime == "CPP" else None), + request_timeout_s=DEFAULT_REQUEST_TIMEOUT_S, + request_max_retries=None, ) as llm: run_accuracy_test(llm, self.MODEL_NAME, ["GSM8K"]) @@ -1160,47 +1121,6 @@ def test_gen_only_spec_dec(self): tensor_parallel_size=4) as llm: run_accuracy_test(llm, self.MODEL_NAME, ["MMLU", "GSM8K"]) - @pytest.mark.skip_less_device(8) - @parametrize_with_ids("overlap_scheduler", [True, False]) - @parametrize_with_ids("mtp_nextn", [0, 2]) - @pytest.mark.skip_less_device(8) - def test_auto_dtype(self, overlap_scheduler, mtp_nextn): - ctx_server_config = {"disable_overlap_scheduler": True} - gen_server_config = {"disable_overlap_scheduler": not overlap_scheduler} - ctx_server_config["cache_transceiver_config"] = { - "backend": "DEFAULT", - "max_tokens_in_buffer": 4096 - } - gen_server_config["cache_transceiver_config"] = { - "backend": "DEFAULT", - "max_tokens_in_buffer": 4096 - } - if mtp_nextn > 0: - ctx_server_config["speculative_config"] = { - "decoding_type": "MTP", - "max_draft_len": mtp_nextn - } - gen_server_config["speculative_config"] = { - "decoding_type": "MTP", - "max_draft_len": mtp_nextn - } - disaggregated_server_config = { - "hostname": "localhost", - "backend": "pytorch", - "context_servers": { - "num_instances": 1 - }, - "generation_servers": { - "num_instances": 1 - } - } - with launch_disaggregated_llm(disaggregated_server_config, - ctx_server_config, - gen_server_config, - self.MODEL_PATH, - tensor_parallel_size=4) as llm: - run_accuracy_test(llm, self.MODEL_NAME, ["MMLU", "GSM8K"]) - @skip_pre_blackwell @pytest.mark.skip_less_device(8) @pytest.mark.parametrize("gen_pp,gen_tp,gen_cp,enable_attention_dp", [ @@ -1286,33 +1206,22 @@ def test_auto_dtype_with_helix(self, comms_medium, cuda_graph_config, self.MODEL_PATH) as llm: run_accuracy_test(llm, self.MODEL_NAME, ["MMLU", "GSM8K"]) - @pytest.mark.skip_less_device(2) - @pytest.mark.skip_less_device_memory(60000) + @pytest.mark.skip_less_device(8) + @parametrize_with_ids("overlap_scheduler", [True, False]) @parametrize_with_ids("mtp_nextn", [0, 2]) - @pytest.mark.parametrize("backend", ["xgrammar", "llguidance"]) - def test_guided_decoding(self, backend: str, mtp_nextn: int, mocker): - mocker.patch.dict(os.environ, {"TRTLLM_XGUIDANCE_LENIENT": "1"}) - ctx_server_config = { - "disable_overlap_scheduler": True, - "kv_cache_config": { - "free_gpu_memory_fraction": 0.8, - }, - "guided_decoding_backend": backend, - "cache_transceiver_config": { - "backend": "DEFAULT", - "max_tokens_in_buffer": 4096 - } + @pytest.mark.skip_less_device(8) + def test_auto_dtype(self, overlap_scheduler, mtp_nextn): + ctx_server_config = {"disable_overlap_scheduler": True} + gen_server_config = {"disable_overlap_scheduler": not overlap_scheduler} + ctx_server_config["cache_transceiver_config"] = { + "backend": "NIXL", + "transceiver_runtime": "PYTHON", + "max_tokens_in_buffer": 4096 } - gen_server_config = { - "disable_overlap_scheduler": False, - "kv_cache_config": { - "free_gpu_memory_fraction": 0.8, - }, - "guided_decoding_backend": backend, - "cache_transceiver_config": { - "backend": "DEFAULT", - "max_tokens_in_buffer": 4096 - } + gen_server_config["cache_transceiver_config"] = { + "backend": "NIXL", + "transceiver_runtime": "PYTHON", + "max_tokens_in_buffer": 4096 } if mtp_nextn > 0: ctx_server_config["speculative_config"] = { @@ -1334,37 +1243,51 @@ def test_guided_decoding(self, backend: str, mtp_nextn: int, mocker): } } with launch_disaggregated_llm(disaggregated_server_config, - ctx_server_config, gen_server_config, - self.MODEL_PATH) as llm: - run_accuracy_test(llm, self.MODEL_NAME, ["JsonModeEval"]) + ctx_server_config, + gen_server_config, + self.MODEL_PATH, + tensor_parallel_size=4) as llm: + run_accuracy_test(llm, self.MODEL_NAME, ["MMLU", "GSM8K"]) @pytest.mark.skip_less_device(2) @pytest.mark.skip_less_device_memory(60000) - @skip_pre_hopper - def test_kv_cache_v2_nixl_python(self): - """Test with use_kv_cache_manager_v2=True, block_reuse=False, backend=NIXL, transceiver_runtime=PYTHON.""" + @parametrize_with_ids("mtp_nextn", [0, 2]) + @pytest.mark.parametrize("backend", ["xgrammar", "llguidance"]) + def test_guided_decoding(self, backend: str, mtp_nextn: int, mocker): + mocker.patch.dict(os.environ, {"TRTLLM_XGUIDANCE_LENIENT": "1"}) ctx_server_config = { "disable_overlap_scheduler": True, "kv_cache_config": { - "enable_block_reuse": False, - "use_kv_cache_manager_v2": True + "free_gpu_memory_fraction": 0.8, }, + "guided_decoding_backend": backend, "cache_transceiver_config": { "backend": "NIXL", - "transceiver_runtime": "PYTHON" + "transceiver_runtime": "PYTHON", + "max_tokens_in_buffer": 4096 } } gen_server_config = { - "disable_overlap_scheduler": True, + "disable_overlap_scheduler": False, "kv_cache_config": { - "enable_block_reuse": False, - "use_kv_cache_manager_v2": True + "free_gpu_memory_fraction": 0.8, }, + "guided_decoding_backend": backend, "cache_transceiver_config": { "backend": "NIXL", - "transceiver_runtime": "PYTHON" + "transceiver_runtime": "PYTHON", + "max_tokens_in_buffer": 4096 } } + if mtp_nextn > 0: + ctx_server_config["speculative_config"] = { + "decoding_type": "MTP", + "max_draft_len": mtp_nextn + } + gen_server_config["speculative_config"] = { + "decoding_type": "MTP", + "max_draft_len": mtp_nextn + } disaggregated_server_config = { "hostname": "localhost", "backend": "pytorch", @@ -1378,7 +1301,7 @@ def test_kv_cache_v2_nixl_python(self): with launch_disaggregated_llm(disaggregated_server_config, ctx_server_config, gen_server_config, self.MODEL_PATH) as llm: - run_accuracy_test(llm, self.MODEL_NAME, ["GSM8K"]) + run_accuracy_test(llm, self.MODEL_NAME, ["JsonModeEval"]) @pytest.mark.skip_less_device(4) @pytest.mark.skip_less_device_memory(60000) @@ -1680,7 +1603,8 @@ class TestDeepSeekV32Exp(LlmapiAccuracyTestHarness): @pytest.mark.parametrize("overlap_scheduler", [False]) def test_auto_dtype(self, overlap_scheduler): cache_transceiver_config = { - "backend": "DEFAULT", + "backend": "NIXL", + "transceiver_runtime": "PYTHON", "max_tokens_in_buffer": 4096 } max_num_tokens = 8192 @@ -1740,62 +1664,6 @@ def test_auto_dtype(self, overlap_scheduler): model_name=self.MODEL_NAME, test_sets=["MMLU", "GSM8K"]) - @pytest.mark.skip_less_device(4) - @pytest.mark.skip_less_device_memory(200000) - @pytest.mark.parametrize("use_kv_cache_manager_v2", [False], - ids=["cache_mgr_v1"]) - def test_kv_cache_v2_nixl_python(self, use_kv_cache_manager_v2): - """Test with KV cache manager v1, block_reuse=False, backend=NIXL, transceiver_runtime=PYTHON.""" - max_num_tokens = 8192 - moe_config = {"backend": "TRTLLM", "max_num_tokens": max_num_tokens} - ctx_server_config = { - "disable_overlap_scheduler": True, - "kv_cache_config": { - "free_gpu_memory_fraction": 0.5, - "enable_block_reuse": False, - "use_kv_cache_manager_v2": use_kv_cache_manager_v2 - }, - "cache_transceiver_config": { - "backend": "NIXL", - "transceiver_runtime": "PYTHON", - "max_tokens_in_buffer": 4096 - }, - "tensor_parallel_size": 2, - "moe_expert_parallel_size": 2, - "enable_autotuner": False, - } - gen_server_config = { - "disable_overlap_scheduler": False, - "moe_config": moe_config, - "kv_cache_config": { - "free_gpu_memory_fraction": 0.5, - "enable_block_reuse": False, - "use_kv_cache_manager_v2": use_kv_cache_manager_v2 - }, - "cache_transceiver_config": { - "backend": "NIXL", - "transceiver_runtime": "PYTHON", - "max_tokens_in_buffer": 4096 - }, - "tensor_parallel_size": 2, - "moe_expert_parallel_size": 2, - "enable_autotuner": False, - } - disaggregated_server_config = { - "hostname": "localhost", - "backend": "pytorch", - "context_servers": { - "num_instances": 1, - }, - "generation_servers": { - "num_instances": 1, - } - } - with launch_disaggregated_llm(disaggregated_server_config, - ctx_server_config, gen_server_config, - self.MODEL_PATH) as llm: - run_accuracy_test(llm, self.MODEL_NAME, ["GSM8K"]) - @pytest.mark.timeout(DEFAULT_TEST_TIMEOUT) @skip_pre_hopper diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_cache_aware_balance_deepseek_v3.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_cache_aware_balance_deepseek_v3.yaml index 615bf8b74d41..282b9a352ff1 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_cache_aware_balance_deepseek_v3.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_cache_aware_balance_deepseek_v3.yaml @@ -16,7 +16,8 @@ context_servers: event_buffer_max_size: 1024 free_gpu_memory_fraction: 0.1 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 2 router: @@ -29,4 +30,5 @@ generation_servers: event_buffer_max_size: 1024 free_gpu_memory_fraction: 0.1 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_cache_reuse_deepseek_v3.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_cache_reuse_deepseek_v3.yaml index 9a51a0f5903d..3e908bcf2ab6 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_cache_reuse_deepseek_v3.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_cache_reuse_deepseek_v3.yaml @@ -17,7 +17,8 @@ context_servers: enable_partial_reuse: true event_buffer_max_size: 1024 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 1 @@ -30,4 +31,5 @@ generation_servers: event_buffer_max_size: 1024 free_gpu_memory_fraction: 0.05 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_conditional_deepseek_v3.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_conditional_deepseek_v3.yaml index 7887fd2725fb..b554f840e302 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_conditional_deepseek_v3.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_conditional_deepseek_v3.yaml @@ -17,7 +17,8 @@ context_servers: event_buffer_max_size: 1024 free_gpu_memory_fraction: 0.15 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 1 @@ -30,4 +31,5 @@ generation_servers: event_buffer_max_size: 1024 free_gpu_memory_fraction: 0.15 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite.yaml index ce4c9b3917bf..ca673a58cf22 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite.yaml @@ -9,10 +9,12 @@ context_servers: tensor_parallel_size: 1 pipeline_parallel_size: 1 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 1 pipeline_parallel_size: 1 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp.yaml index 43081ce00a83..66bb02035726 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp.yaml @@ -13,11 +13,13 @@ context_servers: pipeline_parallel_size: 1 enable_attention_dp: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 1 pipeline_parallel_size: 1 enable_attention_dp: false cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp_attention_dp_overlap.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp_attention_dp_overlap.yaml index 77ebcc6a0585..1f33e3e7201a 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp_attention_dp_overlap.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp_attention_dp_overlap.yaml @@ -13,7 +13,8 @@ context_servers: enable_attention_dp: true disable_overlap_scheduler: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 1 @@ -21,4 +22,5 @@ generation_servers: enable_attention_dp: true disable_overlap_scheduler: false cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp_ctxpp2_gentp2.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp_ctxpp2_gentp2.yaml index efbdc97c4f38..81e3c5d73baf 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp_ctxpp2_gentp2.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_one_mtp_ctxpp2_gentp2.yaml @@ -13,7 +13,8 @@ context_servers: decoding_type: MTP max_draft_len: 1 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 2 @@ -23,4 +24,5 @@ generation_servers: decoding_type: MTP max_draft_len: 1 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_two_mtp.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_two_mtp.yaml index 18cb600debcd..b69aaafc53a9 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_two_mtp.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_two_mtp.yaml @@ -13,11 +13,13 @@ context_servers: pipeline_parallel_size: 1 enable_attention_dp: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 1 pipeline_parallel_size: 1 enable_attention_dp: false cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_ucx.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_ucx.yaml new file mode 100644 index 000000000000..2ee6d65e5e0d --- /dev/null +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_ucx.yaml @@ -0,0 +1,17 @@ +hostname: localhost +model: DeepSeek-V3-Lite/fp8 +free_gpu_memory_fraction: 0.25 +backend: pytorch +disable_overlap_scheduler: true +context_servers: + num_instances: 1 + tensor_parallel_size: 1 + pipeline_parallel_size: 1 + cache_transceiver_config: + backend: UCX +generation_servers: + num_instances: 1 + tensor_parallel_size: 1 + pipeline_parallel_size: 1 + cache_transceiver_config: + backend: UCX diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite.yaml index 0d50737cc267..8fb03e4b5d7f 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite.yaml @@ -9,10 +9,12 @@ context_servers: tensor_parallel_size: 2 pipeline_parallel_size: 1 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 2 pipeline_parallel_size: 1 cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp.yaml index bfec04d70572..698f2542a202 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp.yaml @@ -10,11 +10,13 @@ context_servers: pipeline_parallel_size: 1 enable_attention_dp: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 2 pipeline_parallel_size: 1 enable_attention_dp: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_one.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_one.yaml index 4aa309cf6cf1..3cf3225a30bc 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_one.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_one.yaml @@ -10,11 +10,13 @@ context_servers: pipeline_parallel_size: 1 enable_attention_dp: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 2 pipeline_parallel_size: 1 enable_attention_dp: false cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_one_mtp.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_one_mtp.yaml index 3aa588aaa79a..1a72b6649db8 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_one_mtp.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_one_mtp.yaml @@ -13,11 +13,13 @@ context_servers: pipeline_parallel_size: 1 enable_attention_dp: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 2 pipeline_parallel_size: 1 enable_attention_dp: false cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_overlap.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_overlap.yaml index af8f62e920e1..fb366bdb6b71 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_overlap.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_overlap.yaml @@ -10,7 +10,8 @@ context_servers: enable_attention_dp: true disable_overlap_scheduler: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 2 @@ -18,4 +19,5 @@ generation_servers: enable_attention_dp: true disable_overlap_scheduler: false cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_overlap_cuda_graph.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_overlap_cuda_graph.yaml index acc41bc2dc89..08e340d31cdc 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_overlap_cuda_graph.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_attention_dp_overlap_cuda_graph.yaml @@ -9,7 +9,8 @@ context_servers: enable_attention_dp: true disable_overlap_scheduler: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 2 @@ -19,4 +20,5 @@ generation_servers: enable_padding: false disable_overlap_scheduler: false cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_nixl.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_nixl.yaml index e1628021af57..aa5e722d1963 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_nixl.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_nixl.yaml @@ -9,9 +9,11 @@ context_servers: pipeline_parallel_size: 1 cache_transceiver_config: backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 2 pipeline_parallel_size: 1 cache_transceiver_config: backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_overlap_cuda_graph.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_overlap_cuda_graph.yaml index b9d3f29b40b0..b2ed973ab018 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_overlap_cuda_graph.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_overlap_cuda_graph.yaml @@ -8,7 +8,8 @@ context_servers: pipeline_parallel_size: 1 disable_overlap_scheduler: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 2 @@ -17,4 +18,5 @@ generation_servers: enable_padding: false disable_overlap_scheduler: false cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_transceiver_runtime_python.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_transceiver_runtime_python.yaml deleted file mode 100644 index 21856aabb69f..000000000000 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_transceiver_runtime_python.yaml +++ /dev/null @@ -1,24 +0,0 @@ -hostname: localhost -port: 8000 -model: DeepSeek-V3-Lite/fp8 -free_gpu_memory_fraction: 0.25 -backend: "pytorch" -disable_overlap_scheduler: True -context_servers: - num_instances: 1 - tensor_parallel_size: 2 - pipeline_parallel_size: 1 - cache_transceiver_config: - backend: "NIXL" - transceiver_runtime: "PYTHON" - urls: - - "localhost:8001" -generation_servers: - num_instances: 1 - tensor_parallel_size: 2 - pipeline_parallel_size: 1 - cache_transceiver_config: - backend: "NIXL" - transceiver_runtime: "PYTHON" - urls: - - "localhost:8002" diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2ep2pp2_gentp4_deepseek_v3_lite_one_mtp_block_reuse.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2ep2pp2_gentp4_deepseek_v3_lite_one_mtp_block_reuse.yaml index 18eeab37fb73..8573f6e5477b 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2ep2pp2_gentp4_deepseek_v3_lite_one_mtp_block_reuse.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2ep2pp2_gentp4_deepseek_v3_lite_one_mtp_block_reuse.yaml @@ -16,7 +16,8 @@ context_servers: kv_cache_config: enable_block_reuse: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 4 @@ -29,4 +30,5 @@ generation_servers: kv_cache_config: enable_block_reuse: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2ep2pp2_gentp4_deepseek_v3_lite_one_mtp_block_reuse_chunked.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2ep2pp2_gentp4_deepseek_v3_lite_one_mtp_block_reuse_chunked.yaml index ee58fbfd55a7..f6a6a058fe8e 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2ep2pp2_gentp4_deepseek_v3_lite_one_mtp_block_reuse_chunked.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2ep2pp2_gentp4_deepseek_v3_lite_one_mtp_block_reuse_chunked.yaml @@ -18,7 +18,8 @@ context_servers: kv_cache_config: enable_block_reuse: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 4 @@ -31,4 +32,5 @@ generation_servers: kv_cache_config: enable_block_reuse: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp4_gentp4_deepseek_r1_v2_fp4_tllm.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp4_gentp4_deepseek_r1_v2_fp4_tllm.yaml index 189c85a55ec0..c5c13f39c022 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp4_gentp4_deepseek_r1_v2_fp4_tllm.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp4_gentp4_deepseek_r1_v2_fp4_tllm.yaml @@ -21,7 +21,8 @@ context_servers: cuda_graph_config: null print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 generation_servers: num_instances: 1 @@ -57,5 +58,6 @@ generation_servers: - 1024 print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp4_gentp4_deepseek_r1_v2_fp4_tllm_mtp.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp4_gentp4_deepseek_r1_v2_fp4_tllm_mtp.yaml index 82902fa21f6b..724c56661b9b 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp4_gentp4_deepseek_r1_v2_fp4_tllm_mtp.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp4_gentp4_deepseek_r1_v2_fp4_tllm_mtp.yaml @@ -25,7 +25,8 @@ context_servers: cuda_graph_config: null print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 generation_servers: num_instances: 1 @@ -64,5 +65,6 @@ generation_servers: - 1024 print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_deepseek_v3_lite_empty_batch.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_deepseek_v3_lite_empty_batch.yaml index abf05da97d9d..7e2522cbf717 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_deepseek_v3_lite_empty_batch.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_deepseek_v3_lite_empty_batch.yaml @@ -17,7 +17,8 @@ context_servers: max_tokens: 512 cache_transceiver_config: max_tokens_in_buffer: 8448 - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON generation_servers: num_instances: 1 tensor_parallel_size: 1 @@ -38,6 +39,7 @@ generation_servers: max_tokens: 2560 cache_transceiver_config: max_tokens_in_buffer: 8448 - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON stream_interval: 1 num_postprocess_workers: 1 diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_gentp2_deepseek_v3_lite_attention_dp_gen_only.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_gentp2_deepseek_v3_lite_attention_dp_gen_only.yaml index 308afac71126..1ce1132e9446 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_gentp2_deepseek_v3_lite_attention_dp_gen_only.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_gentp2_deepseek_v3_lite_attention_dp_gen_only.yaml @@ -14,7 +14,8 @@ generation_servers: pipeline_parallel_size: 1 enable_attention_dp: True cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON urls: - "localhost:8002" - "localhost:8003" diff --git a/tests/integration/defs/disaggregated/test_disaggregated.py b/tests/integration/defs/disaggregated/test_disaggregated.py index c0147c8423b4..ab14ed89c8c4 100644 --- a/tests/integration/defs/disaggregated/test_disaggregated.py +++ b/tests/integration/defs/disaggregated/test_disaggregated.py @@ -287,12 +287,12 @@ def get_test_config(test_desc, example_dir, test_root): f"{test_configs_root}/disagg_config_ctxpp4_gentp4.yaml", "deepseek_v3_lite_fp8_mpi": f"{test_configs_root}/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_mpi.yaml", - "deepseek_v3_lite_fp8_ucx": + "deepseek_v3_lite_fp8_tp1_ucx": + f"{test_configs_root}/disagg_config_ctxtp1_gentp1_deepseek_v3_lite_ucx.yaml", + "deepseek_v3_lite_fp8_tp2_ucx": f"{test_configs_root}/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_ucx.yaml", "deepseek_v3_lite_fp8_nixl": f"{test_configs_root}/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_nixl.yaml", - "deepseek_v3_lite_fp8_transceiver_runtime_python": - f"{test_configs_root}/disagg_config_ctxtp2_gentp2_deepseek_v3_lite_transceiver_runtime_python.yaml", "deepseek_v3_lite_fp8_tp1": f"{test_configs_root}/disagg_config_ctxtp1_gentp1_deepseek_v3_lite.yaml", "deepseek_v3_lite_fp8_tp1_mtp": @@ -1876,7 +1876,7 @@ def test_disaggregated_deepseek_v3_lite_fp8_ucx(disaggregated_test_root, env["TRTLLM_USE_UCX_KVCACHE"] = "1" env["UCX_TLS"] = get_ucx_tls() run_disaggregated_test(disaggregated_example_root, - "deepseek_v3_lite_fp8_ucx", + "deepseek_v3_lite_fp8_tp2_ucx", env=env, model_path=deepseek_v3_model_root, cwd=llm_venv.get_working_directory()) @@ -1904,24 +1904,6 @@ def test_disaggregated_deepseek_v3_lite_fp8_nixl(disaggregated_test_root, cwd=llm_venv.get_working_directory()) -@skip_no_hopper -@skip_arm -@pytest.mark.parametrize("deepseek_v3_model_root", ['DeepSeek-V3-Lite-fp8'], - indirect=True) -def test_disaggregated_deepseek_v3_lite_fp8_transceiver_runtime_python( - disaggregated_test_root, disaggregated_example_root, llm_venv, - deepseek_v3_model_root): - setup_model_symlink(llm_venv, deepseek_v3_model_root, - "DeepSeek-V3-Lite/fp8") - env = llm_venv._new_env.copy() - env["UCX_TLS"] = get_ucx_tls() - run_disaggregated_test(disaggregated_example_root, - "deepseek_v3_lite_fp8_transceiver_runtime_python", - env=env, - model_path=deepseek_v3_model_root, - cwd=llm_venv.get_working_directory()) - - @skip_no_hopper @skip_arm @pytest.mark.parametrize("deepseek_v3_model_root", ['DeepSeek-V3-Lite-fp8'], @@ -1936,7 +1918,7 @@ def test_disaggregated_deepseek_v3_lite_fp8_ucx_tp1_single_gpu( env["UCX_TLS"] = get_ucx_tls() run_disaggregated_test(disaggregated_example_root, - "deepseek_v3_lite_fp8_tp1", + "deepseek_v3_lite_fp8_tp1_ucx", env=env, model_path=deepseek_v3_model_root, cwd=llm_venv.get_working_directory()) diff --git a/tests/integration/test_lists/qa/llm_function_core.txt b/tests/integration/test_lists/qa/llm_function_core.txt index 9fde8bb9d1fa..10655a8bb266 100644 --- a/tests/integration/test_lists/qa/llm_function_core.txt +++ b/tests/integration/test_lists/qa/llm_function_core.txt @@ -1,19 +1,16 @@ accuracy/test_disaggregated_serving.py::TestDeepSeekR1::test_kv_cache_v2_nixl_python[cache_mgr_v1] accuracy/test_disaggregated_serving.py::TestDeepSeekV32Exp::test_auto_dtype[False] -accuracy/test_disaggregated_serving.py::TestDeepSeekV32Exp::test_kv_cache_v2_nixl_python[cache_mgr_v1] accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_auto_dtype[mtp_nextn=0-overlap_scheduler=False] accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_auto_dtype[mtp_nextn=0-overlap_scheduler=True] accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_auto_dtype[mtp_nextn=2-overlap_scheduler=False] accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_auto_dtype[mtp_nextn=2-overlap_scheduler=True] accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_auto_dtype_with_helix[fifo_v2-cudagraph:with_padding-pp1dp2cp2] accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_auto_dtype_with_helix[fifo_v2-cudagraph:with_padding-pp1tp2cp2] -accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_gen_only_sync[python] +accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_gen_only_sync accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_guided_decoding[llguidance-mtp_nextn=0] accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_guided_decoding[llguidance-mtp_nextn=2] accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_guided_decoding[xgrammar-mtp_nextn=0] accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_guided_decoding[xgrammar-mtp_nextn=2] -accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_kv_cache_v2_nixl_python -accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_nixl_backend accuracy/test_disaggregated_serving.py::TestGemma3_1BInstruct::test_auto_dtype[False] accuracy/test_disaggregated_serving.py::TestGemma3_1BInstruct::test_auto_dtype[True] accuracy/test_disaggregated_serving.py::TestGemma3_1BInstruct::test_kv_cache_v2_nixl_python[cache_mgr_v1] @@ -872,7 +869,6 @@ disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_tp1 disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_tp1_single_gpu[DeepSeek-V3-Lite-fp8] disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_tp1_single_gpu_mtp[DeepSeek-V3-Lite-fp8] disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_tp1_two_mtp[DeepSeek-V3-Lite-fp8] -disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_transceiver_runtime_python[DeepSeek-V3-Lite-fp8] disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_ucx[DeepSeek-V3-Lite-fp8] disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_ucx_tp1_single_gpu[DeepSeek-V3-Lite-fp8] disaggregated/test_disaggregated.py::test_disaggregated_diff_max_tokens[TinyLlama-1.1B-Chat-v1.0] @@ -947,7 +943,6 @@ disaggregated/test_auto_scaling.py::test_worker_restart[http-kv_cache_aware] disaggregated/test_auto_scaling.py::test_disagg_server_restart[etcd-round_robin] disaggregated/test_auto_scaling.py::test_disagg_server_restart[http-round_robin] disaggregated/test_disaggregated.py::test_disaggregated_overlap_transceiver_runtime_python[TinyLlama-1.1B-Chat-v1.0] -disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_transceiver_runtime_python[DeepSeek-V3-Lite-fp8] disaggregated/test_disaggregated.py::test_disaggregated_overlap_gen_first[ctx_pp1-TinyLlama-1.1B-Chat-v1.0] disaggregated/test_disaggregated.py::test_disaggregated_overlap_gen_first[ctx_pp4-TinyLlama-1.1B-Chat-v1.0] test_e2e.py::test_ptp_quickstart_advanced[Llama3.1-8B-BF16-llama-3.1-model/Meta-Llama-3.1-8B] diff --git a/tests/integration/test_lists/test-db/l0_dgx_b200.yml b/tests/integration/test_lists/test-db/l0_dgx_b200.yml index cd8ab8f2ae74..f06ac5e21e6d 100644 --- a/tests/integration/test_lists/test-db/l0_dgx_b200.yml +++ b/tests/integration/test_lists/test-db/l0_dgx_b200.yml @@ -17,7 +17,7 @@ l0_dgx_b200: tests: - unittest/_torch/misc/test_autotuner.py::test_autotuner_distributed_strategy - accuracy/test_llm_api_pytorch.py::TestQwen3_5_35B_A3B::test_bf16[tp2-TRTLLM] - - accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_gen_only_sync[cpp] + - accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_gen_only_sync # ------------- KV Cache V2 Scheduler IT (multi-GPU) --------------- - kv_cache/test_kv_cache_v2_scheduler.py::TestKVCacheV2DSv3Lite::test_mtp_draft_tokens - kv_cache/test_kv_cache_v2_scheduler.py::TestKVCacheV2DSv3Lite::test_mtp_chunked_draft_tokens diff --git a/tests/integration/test_lists/test-db/l0_dgx_b300.yml b/tests/integration/test_lists/test-db/l0_dgx_b300.yml index 736319d8409f..5394ee8bc016 100644 --- a/tests/integration/test_lists/test-db/l0_dgx_b300.yml +++ b/tests/integration/test_lists/test-db/l0_dgx_b300.yml @@ -68,9 +68,6 @@ l0_dgx_b300: - accuracy/test_llm_api_pytorch.py::TestGPTOSS::test_w4a16[dp4-fp8] - accuracy/test_disaggregated_serving.py::TestQwen3_8B::test_nixl_backend - accuracy/test_disaggregated_serving.py::TestDeepSeekR1::test_kv_cache_v2_nixl_python[cache_mgr_v1] - - accuracy/test_disaggregated_serving.py::TestDeepSeekV32Exp::test_kv_cache_v2_nixl_python[cache_mgr_v1] - - accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_nixl_backend - - accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_kv_cache_v2_nixl_python - accuracy/test_disaggregated_serving.py::TestLlama3_1_8BInstruct::test_kv_cache_v2_nixl_python - accuracy/test_disaggregated_serving.py::TestGPTOSS::test_kv_cache_v2_nixl_python[cache_mgr_v1] - accuracy/test_disaggregated_serving.py::TestGPTOSS::test_kv_cache_v2_nixl_python[cache_mgr_v2] diff --git a/tests/integration/test_lists/test-db/l0_dgx_h100.yml b/tests/integration/test_lists/test-db/l0_dgx_h100.yml index ff1642f5e1e4..02983fdce158 100644 --- a/tests/integration/test_lists/test-db/l0_dgx_h100.yml +++ b/tests/integration/test_lists/test-db/l0_dgx_h100.yml @@ -34,9 +34,7 @@ l0_dgx_h100: - accuracy/test_disaggregated_serving.py::TestQwen3_8B::test_auto_dtype[False-False] - accuracy/test_disaggregated_serving.py::TestQwen3_8B::test_chunked_prefill - accuracy/test_disaggregated_serving.py::TestQwen3_8B::test_nixl_backend - - accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_nixl_backend - - accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_gen_only_sync[python] - - accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_kv_cache_v2_nixl_python + - accuracy/test_disaggregated_serving.py::TestDeepSeekV3Lite::test_gen_only_sync - accuracy/test_disaggregated_serving.py::TestLlama3_1_8BInstruct::test_ngram - accuracy/test_disaggregated_serving.py::TestLlama3_1_8BInstruct::test_kv_cache_v2_nixl_python - accuracy/test_disaggregated_serving.py::TestGemma3_1BInstruct::test_auto_dtype[False] @@ -216,7 +214,6 @@ l0_dgx_h100: - disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_mpi[DeepSeek-V3-Lite-fp8] - disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_ucx[DeepSeek-V3-Lite-fp8] - disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_nixl[DeepSeek-V3-Lite-fp8] - - disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_transceiver_runtime_python[DeepSeek-V3-Lite-fp8] - disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_attention_dp[DeepSeek-V3-Lite-fp8] - disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_attention_dp_overlap[DeepSeek-V3-Lite-fp8] - disaggregated/test_disaggregated.py::test_disaggregated_deepseek_v3_lite_fp8_attention_dp_one[DeepSeek-V3-Lite-fp8]