vllm-project
diff --git a/‎.github/workflows/vllm_ascend_test.yaml‎
Lines changed: 91 additions & 47 deletions b/‎.github/workflows/vllm_ascend_test.yaml‎
Lines changed: 91 additions & 47 deletions
diff --git a/‎.github/workflows/vllm_ascend_test_long_term.yaml‎
Lines changed: 6 additions & 6 deletions b/‎.github/workflows/vllm_ascend_test_long_term.yaml‎
Lines changed: 6 additions & 6 deletions
diff --git a/‎format.sh‎
Lines changed: 1 addition & 1 deletion b/‎format.sh‎
Lines changed: 1 addition & 1 deletion
diff --git a/‎tests/long_term/spec_decode/__init__.py‎ renamed to ‎tests/e2e/long_term/spec_decode/__init__.py‎ b/‎tests/long_term/spec_decode/__init__.py‎ renamed to ‎tests/e2e/long_term/spec_decode/__init__.py‎
diff --git a/‎tests/long_term/spec_decode/conftest.py‎ renamed to ‎tests/e2e/long_term/spec_decode/conftest.py‎ b/‎tests/long_term/spec_decode/conftest.py‎ renamed to ‎tests/e2e/long_term/spec_decode/conftest.py‎
diff --git a/‎tests/long_term/spec_decode/e2e/__init__.py‎ renamed to ‎tests/e2e/long_term/spec_decode/e2e/__init__.py‎ b/‎tests/long_term/spec_decode/e2e/__init__.py‎ renamed to ‎tests/e2e/long_term/spec_decode/e2e/__init__.py‎
diff --git a/‎tests/long_term/spec_decode/e2e/conftest.py‎ renamed to ‎tests/e2e/long_term/spec_decode/e2e/conftest.py‎ b/‎tests/long_term/spec_decode/e2e/conftest.py‎ renamed to ‎tests/e2e/long_term/spec_decode/e2e/conftest.py‎
diff --git a/‎tests/long_term/spec_decode/e2e/test_medusa_correctness.py‎ renamed to ‎tests/e2e/long_term/spec_decode/e2e/test_medusa_correctness.py‎
Lines changed: 2 additions & 2 deletions b/‎tests/long_term/spec_decode/e2e/test_medusa_correctness.py‎ renamed to ‎tests/e2e/long_term/spec_decode/e2e/test_medusa_correctness.py‎
Lines changed: 2 additions & 2 deletions
diff --git a/‎tests/long_term/spec_decode/e2e/test_mlp_correctness.py‎ renamed to ‎tests/e2e/long_term/spec_decode/e2e/test_mlp_correctness.py‎
Lines changed: 2 additions & 2 deletions b/‎tests/long_term/spec_decode/e2e/test_mlp_correctness.py‎ renamed to ‎tests/e2e/long_term/spec_decode/e2e/test_mlp_correctness.py‎
Lines changed: 2 additions & 2 deletions
diff --git a/‎tests/long_term/spec_decode/e2e/test_mtp_correctness.py‎ renamed to ‎tests/e2e/long_term/spec_decode/e2e/test_mtp_correctness.py‎ b/‎tests/long_term/spec_decode/e2e/test_mtp_correctness.py‎ renamed to ‎tests/e2e/long_term/spec_decode/e2e/test_mtp_correctness.py‎
@@ -15,7 +15,7 @@
 # This file is a part of the vllm-ascend project.
 #
 
-name: 'e2e test / basic'
+name: 'test'
 
 on:
   schedule:
@@ -114,6 +114,56 @@ jobs:
           echo "::add-matcher::.github/workflows/matchers/mypy.json"
           tools/mypy.sh 1 ${{ matrix.python-version }}
 
+  ut:
+    needs: [lint]
+    name: unit test
+    if: ${{ needs.lint.result == 'success' }}
+    runs-on: ubuntu-latest
+    container:
+      image: m.daocloud.io/quay.io/ascend/cann:8.1.rc1-910b-ubuntu22.04-py3.10
+      env:
+        VLLM_LOGGING_LEVEL: ERROR
+        VLLM_USE_MODELSCOPE: True
+    strategy:
+      matrix:
+        vllm_version: [main, v0.9.1]
+    steps:
+      - name: Install packages
+        run: |
+          apt-get update -y
+          apt-get install -y python3-pip git vim wget net-tools gcc g++ cmake libnuma-dev
+
+      - name: Checkout vllm-project/vllm repo
+        uses: actions/checkout@v4
+        with:
+          repository: vllm-project/vllm
+          ref: ${{ matrix.vllm_version }}
+          path: ./vllm-empty
+
+      - name: Install vllm-project/vllm from source
+        working-directory: ./vllm-empty
+        run: |
+          VLLM_TARGET_DEVICE=empty python3 -m pip install . --extra-index https://download.pytorch.org/whl/cpu/
+          python3 -m pip uninstall -y triton
+
+      - name: Checkout vllm-project/vllm-ascend repo
+        uses: actions/checkout@v4
+
+      - name: Install vllm-project/vllm-ascend
+        run: |
+          export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/Ascend/ascend-toolkit/latest/x86_64-linux/devlib
+          python3 -m pip install -r requirements-dev.txt --extra-index https://download.pytorch.org/whl/cpu/
+          python3 -m pip install -v . --extra-index https://download.pytorch.org/whl/cpu/
+
+      - name: Run unit test for V1 Engine
+        env:
+          VLLM_USE_V1: 1
+          VLLM_WORKER_MULTIPROC_METHOD: spawn
+          TORCH_DEVICE_BACKEND_AUTOLOAD: 0
+        run: |
+          export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/Ascend/ascend-toolkit/latest/x86_64-linux/devlib
+          pytest -sv tests/unit
+
   e2e:
     needs: [lint]
     if: ${{ needs.lint.result == 'success' }}
@@ -122,7 +172,7 @@ jobs:
       matrix:
         os: [linux-arm64-npu-1]
         vllm_version: [main, v0.9.1]
-    name: vLLM Ascend test
+    name: singlecard e2e test
     runs-on: ${{ matrix.os }}
     container:
       # TODO(yikun): Remove m.daocloud.io prefix when infra proxy ready
@@ -168,53 +218,47 @@ jobs:
           pip install -r requirements-dev.txt
           pip install -v -e .
 
-      - name: Run vllm-project/vllm-ascend test for V1 Engine
+      - name: Run e2e test for V1 Engine
         env:
           VLLM_USE_V1: 1
           VLLM_WORKER_MULTIPROC_METHOD: spawn
           VLLM_USE_MODELSCOPE: True
         run: |
-          pytest -sv tests/singlecard/test_offline_inference.py
+          pytest -sv tests/e2e/singlecard/test_offline_inference.py
           # TODO: switch hf to modelscope
           VLLM_USE_MODELSCOPE=False HF_ENDPOINT=https://hf-mirror.com \
-            pytest -sv tests/singlecard/test_ilama_lora.py
+            pytest -sv tests/e2e/singlecard/test_ilama_lora.py
           # TODO(sss): guided decoding doesn't work, fix it later
-          # pytest -sv tests/singlecard/test_guided_decoding.py
-          # test_ascend_config.py should be ran separately because it will regenerate the global config many times.
-          pytest -sv tests/singlecard/test_ascend_config.py
-          pytest -sv tests/singlecard/test_camem.py
-          pytest -sv tests/singlecard/ \
-          --ignore=tests/singlecard/test_offline_inference.py \
-          --ignore=tests/singlecard/test_ilama_lora.py \
-          --ignore=tests/singlecard/test_guided_decoding.py \
-          --ignore=tests/singlecard/test_ascend_config.py \
-          --ignore=tests/singlecard/test_camem.py
+          # pytest -sv tests/e2e/singlecard/test_guided_decoding.py
+          pytest -sv tests/e2e/singlecard/test_camem.py
+          pytest -sv tests/e2e/singlecard/ \
+          --ignore=tests/e2e/singlecard/test_offline_inference.py \
+          --ignore=tests/e2e/singlecard/test_ilama_lora.py \
+          --ignore=tests/e2e/singlecard/test_guided_decoding.py \
+          --ignore=tests/e2e/singlecard/test_camem.py
 
-      - name: Run vllm-project/vllm-ascend test on V0 engine
+      - name: Run e2e test on V0 engine
         if: ${{ github.event_name == 'schedule' }}
         env:
           VLLM_USE_V1: 0
           VLLM_USE_MODELSCOPE: True
         run: |
-          pytest -sv tests/singlecard/test_offline_inference.py
+          pytest -sv tests/e2e/singlecard/test_offline_inference.py
           # TODO: switch hf to modelscope
           VLLM_USE_MODELSCOPE=False HF_ENDPOINT=https://hf-mirror.com \
-            pytest -sv tests/singlecard/test_ilama_lora.py
+            pytest -sv tests/e2e/singlecard/test_ilama_lora.py
           # guided decoding doesn't work, fix it later
-          # pytest -sv tests/singlecard/test_guided_decoding.py
-          pytest -sv tests/singlecard/test_camem.py
-          # test_ascend_config.py should be ran separately because it will regenerate the global config many times.
-          pytest -sv tests/singlecard/test_ascend_config.py
-          pytest -sv tests/singlecard/test_prompt_embedding.py
-          pytest -sv tests/singlecard/ \
-            --ignore=tests/singlecard/test_offline_inference.py \
-            --ignore=tests/singlecard/test_ilama_lora.py \
-            --ignore=tests/singlecard/test_guided_decoding.py \
-            --ignore=tests/singlecard/test_camem.py \
-            --ignore=tests/singlecard/test_ascend_config.py \
-            --ignore=tests/singlecard/test_prompt_embedding.py \
-            --ignore=tests/singlecard/core/test_ascend_scheduler.py \
-            --ignore=tests/singlecard/core/test_ascend_scheduler_e2e.py
+          # pytest -sv tests/e2e/singlecard/test_guided_decoding.py
+          pytest -sv tests/e2e/singlecard/test_camem.py
+          pytest -sv tests/e2e/singlecard/test_prompt_embedding.py
+          pytest -sv tests/e2e/singlecard/ \
+            --ignore=tests/e2e/singlecard/test_offline_inference.py \
+            --ignore=tests/e2e/singlecard/test_ilama_lora.py \
+            --ignore=tests/e2e/singlecard/test_guided_decoding.py \
+            --ignore=tests/e2e/singlecard/test_camem.py \
+            --ignore=tests/e2e/singlecard/test_prompt_embedding.py \
+            --ignore=tests/e2e/singlecard/core/test_ascend_scheduler.py \
+            --ignore=tests/e2e/singlecard/core/test_ascend_scheduler_e2e.py
 
   e2e-4-cards:
     needs: [e2e]
@@ -224,7 +268,7 @@ jobs:
       matrix:
         os: [linux-arm64-npu-4]
         vllm_version: [main, v0.9.1]
-    name: vLLM Ascend test
+    name: multicard e2e test
     runs-on: ${{ matrix.os }}
     container:
       # TODO(yikun): Remove m.daocloud.io prefix when infra proxy ready
@@ -279,14 +323,14 @@ jobs:
         run: |
           # TODO: switch hf to modelscope
           VLLM_USE_MODELSCOPE=False HF_ENDPOINT=https://hf-mirror.com \
-            pytest -sv tests/multicard/test_ilama_lora_tp2.py
-          # Fixme: run VLLM_USE_MODELSCOPE=True pytest -sv tests/multicard/test_offline_inference_distributed.py will raise error.
+            pytest -sv tests/e2e/multicard/test_ilama_lora_tp2.py
+          # Fixme: run VLLM_USE_MODELSCOPE=True pytest -sv tests/e2e/multicard/test_offline_inference_distributed.py will raise error.
           # To avoid oom, we need to run the test in a single process.
-          pytest -sv tests/multicard/test_offline_inference_distributed.py::test_models_distributed_QwQ
-          pytest -sv tests/multicard/test_offline_inference_distributed.py::test_models_distributed_DeepSeek
-          pytest -sv tests/multicard/test_offline_inference_distributed.py::test_models_distributed_topk
-          pytest -sv tests/multicard/test_offline_inference_distributed.py::test_models_distributed_DeepSeek_W8A8
-          pytest -sv tests/multicard/ --ignore=tests/multicard/test_ilama_lora_tp2.py --ignore=tests/multicard/test_offline_inference_distributed.py
+          pytest -sv tests/e2e/multicard/test_offline_inference_distributed.py::test_models_distributed_QwQ
+          pytest -sv tests/e2e/multicard/test_offline_inference_distributed.py::test_models_distributed_DeepSeek
+          pytest -sv tests/e2e/multicard/test_offline_inference_distributed.py::test_models_distributed_topk
+          pytest -sv tests/e2e/multicard/test_offline_inference_distributed.py::test_models_distributed_DeepSeek_W8A8
+          pytest -sv tests/e2e/multicard/ --ignore=tests/e2e/multicard/test_ilama_lora_tp2.py --ignore=tests/e2e/multicard/test_offline_inference_distributed.py
 
       - name: Run vllm-project/vllm-ascend test on V0 engine
         if: ${{ github.event_name == 'schedule' }}
@@ -296,11 +340,11 @@ jobs:
         run: |
           # TODO: switch hf to modelscope
           VLLM_USE_MODELSCOPE=False HF_ENDPOINT=https://hf-mirror.com \
-            pytest -sv tests/multicard/test_ilama_lora_tp2.py
-          # Fixme: run VLLM_USE_MODELSCOPE=True pytest -sv tests/multicard/test_offline_inference_distributed.py will raise error.
+            pytest -sv tests/e2e/multicard/test_ilama_lora_tp2.py
+          # Fixme: run VLLM_USE_MODELSCOPE=True pytest -sv tests/e2e/multicard/test_offline_inference_distributed.py will raise error.
           # To avoid oom, we need to run the test in a single process.
-          pytest -sv tests/multicard/test_offline_inference_distributed.py::test_models_distributed_QwQ
-          pytest -sv tests/multicard/test_offline_inference_distributed.py::test_models_distributed_DeepSeek
-          pytest -sv tests/multicard/test_offline_inference_distributed.py::test_models_distributed_topk
-          pytest -sv tests/multicard/test_offline_inference_distributed.py::test_models_distributed_DeepSeek_W8A8
-          pytest -sv tests/multicard/ --ignore=tests/multicard/test_ilama_lora_tp2.py --ignore=tests/multicard/test_offline_inference_distributed.py
+          pytest -sv tests/e2e/multicard/test_offline_inference_distributed.py::test_models_distributed_QwQ
+          pytest -sv tests/e2e/multicard/test_offline_inference_distributed.py::test_models_distributed_DeepSeek
+          pytest -sv tests/e2e/multicard/test_offline_inference_distributed.py::test_models_distributed_topk
+          pytest -sv tests/e2e/multicard/test_offline_inference_distributed.py::test_models_distributed_DeepSeek_W8A8
+          pytest -sv tests/e2e/multicard/ --ignore=tests/e2e/multicard/test_ilama_lora_tp2.py --ignore=tests/e2e/multicard/test_offline_inference_distributed.py
@@ -96,12 +96,12 @@ jobs:
         run: |
           if [[ "${{ matrix.os }}" == "linux-arm64-npu-1" ]]; then
             # spec decode test
-            VLLM_USE_MODELSCOPE=True pytest -sv tests/long_term/spec_decode/e2e/test_v1_mtp_correctness.py
+            VLLM_USE_MODELSCOPE=True pytest -sv tests/e2e/long_term/spec_decode/e2e/test_v1_mtp_correctness.py
             # TODO: revert me when test_v1_spec_decode.py::test_ngram_correctness is fixed
-            # VLLM_USE_MODELSCOPE=True pytest -sv tests/long_term/spec_decode/e2e/test_v1_spec_decode.py
-            VLLM_USE_MODELSCOPE=True pytest -sv tests/long_term/spec_decode/e2e/test_mtp_correctness.py  # it needs a clean process
-            pytest -sv tests/long_term/spec_decode --ignore=tests/long_term/spec_decode/e2e/test_mtp_correctness.py --ignore=tests/long_term/spec_decode/e2e/test_v1_spec_decode.py --ignore=tests/long_term/spec_decode/e2e/test_v1_mtp_correctness.py
-            pytest -sv tests/long_term/test_accuracy.py
+            # VLLM_USE_MODELSCOPE=True pytest -sv tests/e2e/long_term/spec_decode/e2e/test_v1_spec_decode.py
+            VLLM_USE_MODELSCOPE=True pytest -sv tests/e2e/long_term/spec_decode/e2e/test_mtp_correctness.py  # it needs a clean process
+            pytest -sv tests/e2e/long_term/spec_decode --ignore=tests/e2e/long_term/spec_decode/e2e/test_mtp_correctness.py --ignore=tests/e2e/long_term/spec_decode/e2e/test_v1_spec_decode.py --ignore=tests/e2e/long_term/spec_decode/e2e/test_v1_mtp_correctness.py
+            pytest -sv tests/e2e/long_term/test_accuracy.py
           else
-            VLLM_USE_MODELSCOPE=True pytest -sv tests/long_term/test_deepseek_v2_lite_tp2_accuracy.py
+            VLLM_USE_MODELSCOPE=True pytest -sv tests/e2e/long_term/test_deepseek_v2_lite_tp2_accuracy.py
           fi
@@ -273,7 +273,7 @@ echo 'vllm-ascend isort: Done'
 # Clang-format section
 # Exclude some files for formatting because they are vendored
 CLANG_FORMAT_EXCLUDES=(
-    'csrc/kernels/pos_encoding_kernels.cpp' 'csrc/kernels/advance_step.cpp' 'csrc/torch_binding.cpp' 'csrc/ops.h'
+    'csrc/kernels/pos_encoding_kernels.cpp' 'csrc/kernels/advance_step.cpp' 'csrc/kernels/get_masked_input_and_mask_kernel.cpp' 'csrc/torch_binding.cpp' 'csrc/ops.h'
 )
 
 # Format specified files with clang-format
 
@@ -41,9 +41,9 @@
 
 import pytest
 
-from tests.long_term.spec_decode.e2e.conftest import \
+from tests.e2e.long_term.spec_decode.e2e.conftest import \
     run_equality_correctness_test
-from tests.long_term.spec_decode.utils import maybe_enable_chunked_prefill
+from tests.e2e.long_term.spec_decode.utils import maybe_enable_chunked_prefill
 
 # main model
 # lmsys/vicuna-7b-v1.3 was to be used but it's causing
 
@@ -41,9 +41,9 @@
 from vllm.model_executor.layers.vocab_parallel_embedding import \
     pad_vocab_size  # noqa: F401
 
-from tests.long_term.spec_decode.e2e.conftest import \
+from tests.e2e.long_term.spec_decode.e2e.conftest import \
     run_equality_correctness_test
-from tests.long_term.spec_decode.utils import maybe_enable_chunked_prefill
+from tests.e2e.long_term.spec_decode.utils import maybe_enable_chunked_prefill
 
 # main model
 MAIN_MODEL = "JackFram/llama-160m"
Original file line number	Diff line number	Diff line change
`@@ -273,7 +273,7 @@ echo 'vllm-ascend isort: Done'`
`273`	`273`	`# Clang-format section`
`274`	`274`	`# Exclude some files for formatting because they are vendored`
`275`	`275`	`CLANG_FORMAT_EXCLUDES=(`
`276`		`- 'csrc/kernels/pos_encoding_kernels.cpp' 'csrc/kernels/advance_step.cpp' 'csrc/torch_binding.cpp' 'csrc/ops.h'`
	`276`	`+ 'csrc/kernels/pos_encoding_kernels.cpp' 'csrc/kernels/advance_step.cpp' 'csrc/kernels/get_masked_input_and_mask_kernel.cpp' 'csrc/torch_binding.cpp' 'csrc/ops.h'`
`277`	`277`	`)`
`278`	`278`
`279`	`279`	`# Format specified files with clang-format`