Skip to content

Not sure what to do #19

Description

@3rdxw

RTX 3080 10GB, 32GB RAM, SSD 4 TB

I'm not sure what is the issue here

FYI, I have set --gpu-memory-utilization=0.8

cudart64_12.dll
Available at:
Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\torch\lib
Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\torchvision
Only

log:

[warn] vcvars64.bat not found at C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Auxiliary\Build\vcvars64.bat - FlashInfer JIT may fail.
[warn] No CUDA Toolkit found with cudart64_12.dll (checked CUDA_PATH, CUDA_HOME, and C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\). Setting CUDA_LIB_PATH to a placeholder so flashinfer's import check passes. Shipped snapshots use TRITON_ATTN so this is fine, but FlashInfer JIT paths (fp8 prefill kernel build) will fail. Install CUDA Toolkit to fully clear this.
[info] MSVC env not available; setting VLLM_USE_FLASHINFER_SAMPLER=0 to skip flashinfer sampler JIT (would crash without cl.exe). Native PyTorch sampler is used instead, slightly slower but reliable.
[info] snapshot prefers GPU 1 but only 1 GPU(s) visible — falling back to GPU 0. If GPU 0 has a display attached, the safety check may trip on --gpu-memory-utilization >= 0.95; lower to 0.92 via the launcher's Edit Snapshots screen if you see 'Free memory on device cuda:0 ... is less than desired'.
============================================================
vLLM serve: qwen3.6-27b-autoround
  Model   : Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\models\Qwen3.6-27B-int4-AutoRound
  Ctx     : 90000  |  TP: 1  |  PP: 1
  KV dtype: fp8_e4m3  |  MTP: True (n=6)
  Listen  : http://0.0.0.0:5001
============================================================
Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Scripts\vllm.exe serve Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\models\Qwen3.6-27B-int4-AutoRound --served-model-name=qwen3.6-27b-autoround --quantization=auto-round --max-model-len=90000 --max-num-seqs=1 --max-num-batched-tokens=4128 --block-size=32 --enable-prefix-caching --enable-chunked-prefill --enable-auto-tool-choice --tool-call-parser=qwen3_coder --reasoning-parser=qwen3 --chat-template=Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\templates\qwen3.5-enhanced.jinja --default-chat-template-kwargs={"preserve_thinking": false} --kv-cache-dtype=fp8_e4m3 --tensor-parallel-size=1 --pipeline-parallel-size=1 --gpu-memory-utilization=0.8 --trust-remote-code --attention-backend=TRITON_ATTN --no-use-tqdm-on-load --host=0.0.0.0 --port=5001 --data-parallel-rpc-port=7943 --limit-mm-per-prompt={"image":0,"video":0} --speculative-config={"method":"mtp","num_speculative_tokens":6}
============================================================
[launcher] tee stdout -> Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\logs\vllm_server.5001.log (also streaming to this terminal)
[launcher] runtime manifest -> Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\logs\runtime\5001.json
(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299]

(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299]        █     █     █▄   ▄█

(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299]  ▄▄ ▄█ █     █     █ ▀▄▀ █  version 0.19.0

(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299]   █▄█▀ █     █     █     █  model   Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\models\Qwen3.6-27B-int4-AutoRound

(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299]    ▀▀  ▀▀▀▀▀ ▀▀▀▀▀ ▀     ▀

(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299]
(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:233] non-default args: {'model_tag': 'Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\models\\Qwen3.6-27B-int4-AutoRound', 'chat_template': 'Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\templates\\qwen3.5-enhanced.jinja', 'default_chat_template_kwargs': {'preserve_thinking': False}, 'enable_auto_tool_choice': True, 'tool_call_parser': 'qwen3_coder', 'host': '0.0.0.0', 'port': 5001, 'model': 'Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\models\\Qwen3.6-27B-int4-AutoRound', 'trust_remote_code': True, 'max_model_len': 90000, 'quantization': 'auto-round', 'served_model_name': ['qwen3.6-27b-autoround'], 'use_tqdm_on_load': False, 'attention_backend': 'TRITON_ATTN', 'reasoning_parser': 'qwen3', 'data_parallel_rpc_port': 7943, 'block_size': 32, 'gpu_memory_utilization': 0.8, 'kv_cache_dtype': 'fp8_e4m3', 'enable_prefix_caching': True, 'limit_mm_per_prompt': {'image': 0, 'video': 0}, 'max_num_batched_tokens': 4128, 'max_num_seqs': 1, 'enable_chunked_prefill': True, 'speculative_config': {'method': 'mtp', 'num_speculative_tokens': 6}}
(APIServer pid=16148) INFO 05-16 13:25:03 [system_utils.py:279] Windows detected, skipping ulimit adjustment.
(APIServer pid=16148) WARNING 05-16 13:25:03 [envs.py:1786] Unknown vLLM environment variable detected: VLLM_ATTENTION_BACKEND
(APIServer pid=16148) WARNING 05-16 13:25:03 [envs.py:1786] Unknown vLLM environment variable detected: VLLM_MODEL_DIR
(APIServer pid=16148) WARNING 05-16 13:25:03 [envs.py:1786] Unknown vLLM environment variable detected: VLLM_SLEEP_WHEN_IDLE
(APIServer pid=16148) INFO 05-16 13:25:03 [model.py:554] Resolved architecture: Qwen3_5ForConditionalGeneration
(APIServer pid=16148) INFO 05-16 13:25:03 [model.py:1685] Using max model len 90000
(APIServer pid=16148) INFO 05-16 13:25:03 [cache.py:253] Using fp8_e4m3 data type to store kv cache. It reduces the GPU memory footprint and boosts the performance. Meanwhile, it may cause accuracy drop without a proper scaling factor
(APIServer pid=16148) INFO 05-16 13:25:03 [model.py:554] Resolved architecture: Qwen3_5MTP
(APIServer pid=16148) INFO 05-16 13:25:03 [model.py:1685] Using max model len 262144
(APIServer pid=16148) WARNING 05-16 13:25:03 [speculative.py:521] Enabling num_speculative_tokens > 1 will run multiple times of forward on same MTP layer,which may result in lower acceptance rate
(APIServer pid=16148) INFO 05-16 13:25:03 [scheduler.py:238] Chunked prefill is enabled with max_num_batched_tokens=4128.
(APIServer pid=16148) WARNING 05-16 13:25:03 [config.py:306] Mamba cache mode is set to 'align' for Qwen3_5ForConditionalGeneration by default when prefix caching is enabled
(APIServer pid=16148) INFO 05-16 13:25:03 [config.py:326] Warning: Prefix caching in Mamba cache 'align' mode is currently enabled. Its support for Mamba layers is experimental. Please report any issues you may observe.
(APIServer pid=16148) INFO 05-16 13:25:03 [vllm.py:799] Asynchronous scheduling is enabled.
(APIServer pid=16148) INFO 05-16 13:25:03 [kernel.py:199] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['native'])
(APIServer pid=16148) WARNING 05-16 13:25:03 [vllm.py:1362] max_num_scheduled_tokens is set to 4128 based on the speculative decoding settings. This may lead to suboptimal performance. Consider increasing max_num_batched_tokens to accommodate the additional draft token slots, or decrease num_speculative_tokens or max_num_seqs.
(APIServer pid=16148) INFO 05-16 13:25:04 [registry.py:126] All limits of multimodal modalities supported by the model are set to 0, running in text-only mode.
(EngineCore pid=16744) INFO 05-16 13:25:10 [core.py:105] Initializing a V1 LLM engine (v0.19.0) with config: model='Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\models\\Qwen3.6-27B-int4-AutoRound', speculative_config=SpeculativeConfig(method='mtp', model='Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\models\\Qwen3.6-27B-int4-AutoRound', num_spec_tokens=6), tokenizer='Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\models\\Qwen3.6-27B-int4-AutoRound', skip_tokenizer_init=False, tokenizer_mode=auto, revision=None, tokenizer_revision=None, trust_remote_code=True, dtype=torch.bfloat16, max_seq_len=90000, download_dir=None, load_format=auto, tensor_parallel_size=1, pipeline_parallel_size=1, data_parallel_size=1, decode_context_parallel_size=1, dcp_comm_backend=ag_rs, disable_custom_all_reduce=False, quantization=inc, quantization_config=None, enforce_eager=False, enable_return_routed_experts=False, kv_cache_dtype=fp8_e4m3, device_config=cuda, structured_outputs_config=StructuredOutputsConfig(backend='auto', disable_any_whitespace=False, disable_additional_properties=False, reasoning_parser='qwen3', reasoning_parser_plugin='', enable_in_reasoning=False), observability_config=ObservabilityConfig(show_hidden_metrics_for_version=None, otlp_traces_endpoint=None, collect_detailed_traces=None, kv_cache_metrics=False, kv_cache_metrics_sample=0.01, cudagraph_metrics=False, enable_layerwise_nvtx_tracing=False, enable_mfu_metrics=False, enable_mm_processor_stats=False, enable_logging_iteration_details=False), seed=0, served_model_name=qwen3.6-27b-autoround, enable_prefix_caching=True, enable_chunked_prefill=True, pooler_config=None, compilation_config={'mode': <CompilationMode.VLLM_COMPILE: 3>, 'debug_dump_path': None, 'cache_dir': '', 'compile_cache_save_format': 'binary', 'backend': 'inductor', 'custom_ops': ['none'], 'ir_enable_torch_wrap': True, 'splitting_ops': ['vllm::unified_attention', 'vllm::unified_attention_with_output', 'vllm::unified_mla_attention', 'vllm::unified_mla_attention_with_output', 'vllm::mamba_mixer2', 'vllm::mamba_mixer', 'vllm::short_conv', 'vllm::linear_attention', 'vllm::plamo2_mamba_mixer', 'vllm::gdn_attention_core', 'vllm::olmo_hybrid_gdn_full_forward', 'vllm::kda_attention', 'vllm::sparse_attn_indexer', 'vllm::rocm_aiter_sparse_attn_indexer', 'vllm::unified_kv_cache_update', 'vllm::unified_mla_kv_cache_update'], 'compile_mm_encoder': False, 'cudagraph_mm_encoder': False, 'encoder_cudagraph_token_budgets': [], 'encoder_cudagraph_max_images_per_batch': 0, 'compile_sizes': [], 'compile_ranges_endpoints': [4128], 'inductor_compile_config': {'enable_auto_functionalized_v2': False, 'size_asserts': False, 'alignment_asserts': False, 'scalar_asserts': False, 'combo_kernels': True, 'benchmark_combo_kernel': True}, 'inductor_passes': {}, 'cudagraph_mode': <CUDAGraphMode.FULL_AND_PIECEWISE: (2, 1)>, 'cudagraph_num_of_warmups': 1, 'cudagraph_capture_sizes': [1, 2, 4, 8], 'cudagraph_copy_inputs': False, 'cudagraph_specialize_lora': True, 'use_inductor_graph_partition': False, 'pass_config': {'fuse_norm_quant': False, 'fuse_act_quant': False, 'fuse_attn_quant': False, 'enable_sp': False, 'fuse_gemm_comms': False, 'fuse_allreduce_rms': False}, 'max_cudagraph_capture_size': 8, 'dynamic_shapes_config': {'type': <DynamicShapesType.BACKED: 'backed'>, 'evaluate_guards': False, 'assume_32_bit_indexing': False}, 'local_cache_dir': None, 'fast_moe_cold_start': False, 'static_all_moe_layers': []}, kernel_config=KernelConfig(ir_op_priority=IrOpPriorityConfig(rms_norm=['native']), enable_flashinfer_autotune=True, moe_backend='auto')
(EngineCore pid=16744) INFO 05-16 13:25:11 [registry.py:126] All limits of multimodal modalities supported by the model are set to 0, running in text-only mode.
(EngineCore pid=16744) INFO 05-16 13:25:11 [parallel_state.py:1455] world_size=1 rank=0 local_rank=0 distributed_init_method=tcp://192.168.8.2:7983 backend=gloo
[W516 13:25:11.000000000 socket.cpp:764] [c10d] The client socket has failed to connect to [DESKTOP-SQBE5H0]:7983 (system error: 10049 - unknown error).
(EngineCore pid=16744) INFO 05-16 13:25:11 [parallel_state.py:1767] rank 0 in world size 1 is assigned as DP rank 0, PP rank 0, PCP rank 0, TP rank 0, EP rank N/A, EPLB rank N/A
(EngineCore pid=16744) Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\spec_decode\eagle.py:136: UserWarning: expandable_segments not supported on this platform (Triggered internally at C:\actions-runner\_work\pytorch\pytorch\pytorch\c10/cuda/CUDAAllocatorConfig.h:39.)
(EngineCore pid=16744)   self.input_ids = torch.zeros(
(EngineCore pid=16744) WARNING 05-16 13:25:11 [__init__.py:206] min_p and logit_bias parameters won't work with speculative decoding.
(EngineCore pid=16744) INFO 05-16 13:25:11 [gpu_model_runner.py:4735] Starting to load model Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\models\Qwen3.6-27B-int4-AutoRound...
(EngineCore pid=16744) INFO 05-16 13:25:11 [cuda.py:418] Using backend AttentionBackendEnum.FLASH_ATTN for vit attention(EngineCore pid=16744) INFO 05-16 13:25:11 [mm_encoder_attention.py:230] Using AttentionBackendEnum.FLASH_ATTN for MMEncoderAttention.
(EngineCore pid=16744) INFO 05-16 13:25:12 [gptq_marlin.py:382] Using MarlinLinearKernel for GPTQMarlinLinearMethod
(EngineCore pid=16744) INFO 05-16 13:25:12 [gdn_linear_attn.py:150] Using Triton/FLA GDN prefill kernel
(EngineCore pid=16744) INFO 05-16 13:25:12 [cuda.py:302] Using AttentionBackendEnum.TRITON_ATTN backend.
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] EngineCore failed to start.

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] Traceback (most recent call last):

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 1082, in run_engine_core

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     engine_core = EngineCoreProc(*args, engine_index=dp_rank, **kwargs)

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]                   ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     return func(*args, **kwargs)

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]            ^^^^^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 848, in __init__

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     super().__init__(

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 114, in __init__

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     self.model_executor = executor_class(vllm_config)

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]                           ^^^^^^^^^^^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     return func(*args, **kwargs)

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]            ^^^^^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\executor\abstract.py", line 109, in __init__

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     self._init_executor()

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\executor\uniproc_executor.py", line 52, in _init_executor

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     self.driver_worker.load_model()

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\worker\gpu_worker.py", line 324, in load_model

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     self.model_runner.load_model(load_dummy_weights=load_dummy_weights)

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     return func(*args, **kwargs)

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]            ^^^^^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\worker\gpu_model_runner.py", line 4751, in load_model

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     self.model = model_loader.load_model(

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]                  ^^^^^^^^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     return func(*args, **kwargs)

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]            ^^^^^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\model_loader\base_loader.py", line 55, in load_model

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     model = initialize_model(

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]             ^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     return func(*args, **kwargs)

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]            ^^^^^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\model_loader\utils.py", line 57, in initialize_model

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     model = model_class(vllm_config=vllm_config, prefix=prefix)

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\models\qwen3_5.py", line 606, in __init__

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     self.language_model = Qwen3_5ForCausalLM(

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]                           ^^^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\models\qwen3_5.py", line 481, in __init__

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     self.model = Qwen3_5Model(

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]                  ^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\decorators.py", line 401, in __init__

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     TorchCompileWithNoGuardsWrapper.__init__(

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\wrapper.py", line 96, in __init__

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     backend = vllm_config.compilation_config.init_backend(

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]               ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\config\compilation.py", line 1015, in init_backend

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     from vllm.compilation.backends import VllmBackend

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\backends.py", line 48, in <module>

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     from .passes.pass_manager import PostGradPassManager

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\passes\pass_manager.py", line 39, in <module>

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     from .fusion.allreduce_rms_fusion import AllReduceFusionPass

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\passes\fusion\allreduce_rms_fusion.py", line 42, in <module>

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     import flashinfer.comm as _flashinfer_comm

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\flashinfer\__init__.py", line 24, in <module>

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     from . import jit as jit

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\flashinfer\jit\__init__.py", line 120, in <module>

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]     ctypes.CDLL(

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108]   File "ctypes\__init__.py", line 379, in __init__

(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] FileNotFoundError: Could not find module 'Z:\qwen3.6-windows-server-portable-x64\bin\cudart64_12.dll' (or one of its dependencies). Try using the full path with constructor syntax.
(EngineCore pid=16744) Process EngineCore:
(EngineCore pid=16744) Traceback (most recent call last):
(EngineCore pid=16744)   File "multiprocessing\process.py", line 314, in _bootstrap
(EngineCore pid=16744)   File "multiprocessing\process.py", line 108, in run
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 1112, in run_engine_core
(EngineCore pid=16744)     raise e
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 1082, in run_engine_core
(EngineCore pid=16744)     engine_core = EngineCoreProc(*args, engine_index=dp_rank, **kwargs)
(EngineCore pid=16744)                   ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744)     return func(*args, **kwargs)
(EngineCore pid=16744)            ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 848, in __init__
(EngineCore pid=16744)     super().__init__(
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 114, in __init__
(EngineCore pid=16744)     self.model_executor = executor_class(vllm_config)
(EngineCore pid=16744)                           ^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744)     return func(*args, **kwargs)
(EngineCore pid=16744)            ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\executor\abstract.py", line 109, in __init__
(EngineCore pid=16744)     self._init_executor()
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\executor\uniproc_executor.py", line 52, in _init_executor
(EngineCore pid=16744)     self.driver_worker.load_model()
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\worker\gpu_worker.py", line 324, in load_model
(EngineCore pid=16744)     self.model_runner.load_model(load_dummy_weights=load_dummy_weights)
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744)     return func(*args, **kwargs)
(EngineCore pid=16744)            ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\worker\gpu_model_runner.py", line 4751, in load_model
(EngineCore pid=16744)     self.model = model_loader.load_model(
(EngineCore pid=16744)                  ^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744)     return func(*args, **kwargs)
(EngineCore pid=16744)            ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\model_loader\base_loader.py", line 55, in load_model
(EngineCore pid=16744)     model = initialize_model(
(EngineCore pid=16744)             ^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744)     return func(*args, **kwargs)
(EngineCore pid=16744)            ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\model_loader\utils.py", line 57, in initialize_model
(EngineCore pid=16744)     model = model_class(vllm_config=vllm_config, prefix=prefix)
(EngineCore pid=16744)             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\models\qwen3_5.py", line 606, in __init__
(EngineCore pid=16744)     self.language_model = Qwen3_5ForCausalLM(
(EngineCore pid=16744)                           ^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\models\qwen3_5.py", line 481, in __init__
(EngineCore pid=16744)     self.model = Qwen3_5Model(
(EngineCore pid=16744)                  ^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\decorators.py", line 401, in __init__
(EngineCore pid=16744)     TorchCompileWithNoGuardsWrapper.__init__(
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\wrapper.py", line 96, in __init__
(EngineCore pid=16744)     backend = vllm_config.compilation_config.init_backend(
(EngineCore pid=16744)               ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\config\compilation.py", line 1015, in init_backend
(EngineCore pid=16744)     from vllm.compilation.backends import VllmBackend
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\backends.py", line 48, in <module>
(EngineCore pid=16744)     from .passes.pass_manager import PostGradPassManager
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\passes\pass_manager.py", line 39, in <module>
(EngineCore pid=16744)     from .fusion.allreduce_rms_fusion import AllReduceFusionPass
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\passes\fusion\allreduce_rms_fusion.py", line 42, in <module>
(EngineCore pid=16744)     import flashinfer.comm as _flashinfer_comm
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\flashinfer\__init__.py", line 24, in <module>
(EngineCore pid=16744)     from . import jit as jit
(EngineCore pid=16744)   File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\flashinfer\jit\__init__.py", line 120, in <module>
(EngineCore pid=16744)     ctypes.CDLL(
(EngineCore pid=16744)   File "ctypes\__init__.py", line 379, in __init__
(EngineCore pid=16744) FileNotFoundError: Could not find module 'Z:\qwen3.6-windows-server-portable-x64\bin\cudart64_12.dll' (or one of its dependencies). Try using the full path with constructor syntax.

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions