[warn] vcvars64.bat not found at C:\Program Files\Microsoft Visual Studio\2022\Community\VC\Auxiliary\Build\vcvars64.bat - FlashInfer JIT may fail.
[warn] No CUDA Toolkit found with cudart64_12.dll (checked CUDA_PATH, CUDA_HOME, and C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\). Setting CUDA_LIB_PATH to a placeholder so flashinfer's import check passes. Shipped snapshots use TRITON_ATTN so this is fine, but FlashInfer JIT paths (fp8 prefill kernel build) will fail. Install CUDA Toolkit to fully clear this.
[info] MSVC env not available; setting VLLM_USE_FLASHINFER_SAMPLER=0 to skip flashinfer sampler JIT (would crash without cl.exe). Native PyTorch sampler is used instead, slightly slower but reliable.
[info] snapshot prefers GPU 1 but only 1 GPU(s) visible — falling back to GPU 0. If GPU 0 has a display attached, the safety check may trip on --gpu-memory-utilization >= 0.95; lower to 0.92 via the launcher's Edit Snapshots screen if you see 'Free memory on device cuda:0 ... is less than desired'.
============================================================
vLLM serve: qwen3.6-27b-autoround
Model : Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\models\Qwen3.6-27B-int4-AutoRound
Ctx : 90000 | TP: 1 | PP: 1
KV dtype: fp8_e4m3 | MTP: True (n=6)
Listen : http://0.0.0.0:5001
============================================================
Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Scripts\vllm.exe serve Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\models\Qwen3.6-27B-int4-AutoRound --served-model-name=qwen3.6-27b-autoround --quantization=auto-round --max-model-len=90000 --max-num-seqs=1 --max-num-batched-tokens=4128 --block-size=32 --enable-prefix-caching --enable-chunked-prefill --enable-auto-tool-choice --tool-call-parser=qwen3_coder --reasoning-parser=qwen3 --chat-template=Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\templates\qwen3.5-enhanced.jinja --default-chat-template-kwargs={"preserve_thinking": false} --kv-cache-dtype=fp8_e4m3 --tensor-parallel-size=1 --pipeline-parallel-size=1 --gpu-memory-utilization=0.8 --trust-remote-code --attention-backend=TRITON_ATTN --no-use-tqdm-on-load --host=0.0.0.0 --port=5001 --data-parallel-rpc-port=7943 --limit-mm-per-prompt={"image":0,"video":0} --speculative-config={"method":"mtp","num_speculative_tokens":6}
============================================================
[launcher] tee stdout -> Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\logs\vllm_server.5001.log (also streaming to this terminal)
[launcher] runtime manifest -> Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\logs\runtime\5001.json
(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299]
(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299] █ █ █▄ ▄█
(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299] ▄▄ ▄█ █ █ █ ▀▄▀ █ version 0.19.0
(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299] █▄█▀ █ █ █ █ model Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\models\Qwen3.6-27B-int4-AutoRound
(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299] ▀▀ ▀▀▀▀▀ ▀▀▀▀▀ ▀ ▀
(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:299]
(APIServer pid=16148) INFO 05-16 13:25:03 [utils.py:233] non-default args: {'model_tag': 'Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\models\\Qwen3.6-27B-int4-AutoRound', 'chat_template': 'Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\templates\\qwen3.5-enhanced.jinja', 'default_chat_template_kwargs': {'preserve_thinking': False}, 'enable_auto_tool_choice': True, 'tool_call_parser': 'qwen3_coder', 'host': '0.0.0.0', 'port': 5001, 'model': 'Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\models\\Qwen3.6-27B-int4-AutoRound', 'trust_remote_code': True, 'max_model_len': 90000, 'quantization': 'auto-round', 'served_model_name': ['qwen3.6-27b-autoround'], 'use_tqdm_on_load': False, 'attention_backend': 'TRITON_ATTN', 'reasoning_parser': 'qwen3', 'data_parallel_rpc_port': 7943, 'block_size': 32, 'gpu_memory_utilization': 0.8, 'kv_cache_dtype': 'fp8_e4m3', 'enable_prefix_caching': True, 'limit_mm_per_prompt': {'image': 0, 'video': 0}, 'max_num_batched_tokens': 4128, 'max_num_seqs': 1, 'enable_chunked_prefill': True, 'speculative_config': {'method': 'mtp', 'num_speculative_tokens': 6}}
(APIServer pid=16148) INFO 05-16 13:25:03 [system_utils.py:279] Windows detected, skipping ulimit adjustment.
(APIServer pid=16148) WARNING 05-16 13:25:03 [envs.py:1786] Unknown vLLM environment variable detected: VLLM_ATTENTION_BACKEND
(APIServer pid=16148) WARNING 05-16 13:25:03 [envs.py:1786] Unknown vLLM environment variable detected: VLLM_MODEL_DIR
(APIServer pid=16148) WARNING 05-16 13:25:03 [envs.py:1786] Unknown vLLM environment variable detected: VLLM_SLEEP_WHEN_IDLE
(APIServer pid=16148) INFO 05-16 13:25:03 [model.py:554] Resolved architecture: Qwen3_5ForConditionalGeneration
(APIServer pid=16148) INFO 05-16 13:25:03 [model.py:1685] Using max model len 90000
(APIServer pid=16148) INFO 05-16 13:25:03 [cache.py:253] Using fp8_e4m3 data type to store kv cache. It reduces the GPU memory footprint and boosts the performance. Meanwhile, it may cause accuracy drop without a proper scaling factor
(APIServer pid=16148) INFO 05-16 13:25:03 [model.py:554] Resolved architecture: Qwen3_5MTP
(APIServer pid=16148) INFO 05-16 13:25:03 [model.py:1685] Using max model len 262144
(APIServer pid=16148) WARNING 05-16 13:25:03 [speculative.py:521] Enabling num_speculative_tokens > 1 will run multiple times of forward on same MTP layer,which may result in lower acceptance rate
(APIServer pid=16148) INFO 05-16 13:25:03 [scheduler.py:238] Chunked prefill is enabled with max_num_batched_tokens=4128.
(APIServer pid=16148) WARNING 05-16 13:25:03 [config.py:306] Mamba cache mode is set to 'align' for Qwen3_5ForConditionalGeneration by default when prefix caching is enabled
(APIServer pid=16148) INFO 05-16 13:25:03 [config.py:326] Warning: Prefix caching in Mamba cache 'align' mode is currently enabled. Its support for Mamba layers is experimental. Please report any issues you may observe.
(APIServer pid=16148) INFO 05-16 13:25:03 [vllm.py:799] Asynchronous scheduling is enabled.
(APIServer pid=16148) INFO 05-16 13:25:03 [kernel.py:199] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['native'])
(APIServer pid=16148) WARNING 05-16 13:25:03 [vllm.py:1362] max_num_scheduled_tokens is set to 4128 based on the speculative decoding settings. This may lead to suboptimal performance. Consider increasing max_num_batched_tokens to accommodate the additional draft token slots, or decrease num_speculative_tokens or max_num_seqs.
(APIServer pid=16148) INFO 05-16 13:25:04 [registry.py:126] All limits of multimodal modalities supported by the model are set to 0, running in text-only mode.
(EngineCore pid=16744) INFO 05-16 13:25:10 [core.py:105] Initializing a V1 LLM engine (v0.19.0) with config: model='Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\models\\Qwen3.6-27B-int4-AutoRound', speculative_config=SpeculativeConfig(method='mtp', model='Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\models\\Qwen3.6-27B-int4-AutoRound', num_spec_tokens=6), tokenizer='Z:\\qwen3.6-windows-server-portable-x64\\qwen3.6-windows-server\\models\\Qwen3.6-27B-int4-AutoRound', skip_tokenizer_init=False, tokenizer_mode=auto, revision=None, tokenizer_revision=None, trust_remote_code=True, dtype=torch.bfloat16, max_seq_len=90000, download_dir=None, load_format=auto, tensor_parallel_size=1, pipeline_parallel_size=1, data_parallel_size=1, decode_context_parallel_size=1, dcp_comm_backend=ag_rs, disable_custom_all_reduce=False, quantization=inc, quantization_config=None, enforce_eager=False, enable_return_routed_experts=False, kv_cache_dtype=fp8_e4m3, device_config=cuda, structured_outputs_config=StructuredOutputsConfig(backend='auto', disable_any_whitespace=False, disable_additional_properties=False, reasoning_parser='qwen3', reasoning_parser_plugin='', enable_in_reasoning=False), observability_config=ObservabilityConfig(show_hidden_metrics_for_version=None, otlp_traces_endpoint=None, collect_detailed_traces=None, kv_cache_metrics=False, kv_cache_metrics_sample=0.01, cudagraph_metrics=False, enable_layerwise_nvtx_tracing=False, enable_mfu_metrics=False, enable_mm_processor_stats=False, enable_logging_iteration_details=False), seed=0, served_model_name=qwen3.6-27b-autoround, enable_prefix_caching=True, enable_chunked_prefill=True, pooler_config=None, compilation_config={'mode': <CompilationMode.VLLM_COMPILE: 3>, 'debug_dump_path': None, 'cache_dir': '', 'compile_cache_save_format': 'binary', 'backend': 'inductor', 'custom_ops': ['none'], 'ir_enable_torch_wrap': True, 'splitting_ops': ['vllm::unified_attention', 'vllm::unified_attention_with_output', 'vllm::unified_mla_attention', 'vllm::unified_mla_attention_with_output', 'vllm::mamba_mixer2', 'vllm::mamba_mixer', 'vllm::short_conv', 'vllm::linear_attention', 'vllm::plamo2_mamba_mixer', 'vllm::gdn_attention_core', 'vllm::olmo_hybrid_gdn_full_forward', 'vllm::kda_attention', 'vllm::sparse_attn_indexer', 'vllm::rocm_aiter_sparse_attn_indexer', 'vllm::unified_kv_cache_update', 'vllm::unified_mla_kv_cache_update'], 'compile_mm_encoder': False, 'cudagraph_mm_encoder': False, 'encoder_cudagraph_token_budgets': [], 'encoder_cudagraph_max_images_per_batch': 0, 'compile_sizes': [], 'compile_ranges_endpoints': [4128], 'inductor_compile_config': {'enable_auto_functionalized_v2': False, 'size_asserts': False, 'alignment_asserts': False, 'scalar_asserts': False, 'combo_kernels': True, 'benchmark_combo_kernel': True}, 'inductor_passes': {}, 'cudagraph_mode': <CUDAGraphMode.FULL_AND_PIECEWISE: (2, 1)>, 'cudagraph_num_of_warmups': 1, 'cudagraph_capture_sizes': [1, 2, 4, 8], 'cudagraph_copy_inputs': False, 'cudagraph_specialize_lora': True, 'use_inductor_graph_partition': False, 'pass_config': {'fuse_norm_quant': False, 'fuse_act_quant': False, 'fuse_attn_quant': False, 'enable_sp': False, 'fuse_gemm_comms': False, 'fuse_allreduce_rms': False}, 'max_cudagraph_capture_size': 8, 'dynamic_shapes_config': {'type': <DynamicShapesType.BACKED: 'backed'>, 'evaluate_guards': False, 'assume_32_bit_indexing': False}, 'local_cache_dir': None, 'fast_moe_cold_start': False, 'static_all_moe_layers': []}, kernel_config=KernelConfig(ir_op_priority=IrOpPriorityConfig(rms_norm=['native']), enable_flashinfer_autotune=True, moe_backend='auto')
(EngineCore pid=16744) INFO 05-16 13:25:11 [registry.py:126] All limits of multimodal modalities supported by the model are set to 0, running in text-only mode.
(EngineCore pid=16744) INFO 05-16 13:25:11 [parallel_state.py:1455] world_size=1 rank=0 local_rank=0 distributed_init_method=tcp://192.168.8.2:7983 backend=gloo
[W516 13:25:11.000000000 socket.cpp:764] [c10d] The client socket has failed to connect to [DESKTOP-SQBE5H0]:7983 (system error: 10049 - unknown error).
(EngineCore pid=16744) INFO 05-16 13:25:11 [parallel_state.py:1767] rank 0 in world size 1 is assigned as DP rank 0, PP rank 0, PCP rank 0, TP rank 0, EP rank N/A, EPLB rank N/A
(EngineCore pid=16744) Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\spec_decode\eagle.py:136: UserWarning: expandable_segments not supported on this platform (Triggered internally at C:\actions-runner\_work\pytorch\pytorch\pytorch\c10/cuda/CUDAAllocatorConfig.h:39.)
(EngineCore pid=16744) self.input_ids = torch.zeros(
(EngineCore pid=16744) WARNING 05-16 13:25:11 [__init__.py:206] min_p and logit_bias parameters won't work with speculative decoding.
(EngineCore pid=16744) INFO 05-16 13:25:11 [gpu_model_runner.py:4735] Starting to load model Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\models\Qwen3.6-27B-int4-AutoRound...
(EngineCore pid=16744) INFO 05-16 13:25:11 [cuda.py:418] Using backend AttentionBackendEnum.FLASH_ATTN for vit attention(EngineCore pid=16744) INFO 05-16 13:25:11 [mm_encoder_attention.py:230] Using AttentionBackendEnum.FLASH_ATTN for MMEncoderAttention.
(EngineCore pid=16744) INFO 05-16 13:25:12 [gptq_marlin.py:382] Using MarlinLinearKernel for GPTQMarlinLinearMethod
(EngineCore pid=16744) INFO 05-16 13:25:12 [gdn_linear_attn.py:150] Using Triton/FLA GDN prefill kernel
(EngineCore pid=16744) INFO 05-16 13:25:12 [cuda.py:302] Using AttentionBackendEnum.TRITON_ATTN backend.
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] EngineCore failed to start.
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] Traceback (most recent call last):
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 1082, in run_engine_core
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] engine_core = EngineCoreProc(*args, engine_index=dp_rank, **kwargs)
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] return func(*args, **kwargs)
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 848, in __init__
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] super().__init__(
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 114, in __init__
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] self.model_executor = executor_class(vllm_config)
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] return func(*args, **kwargs)
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\executor\abstract.py", line 109, in __init__
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] self._init_executor()
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\executor\uniproc_executor.py", line 52, in _init_executor
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] self.driver_worker.load_model()
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\worker\gpu_worker.py", line 324, in load_model
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] self.model_runner.load_model(load_dummy_weights=load_dummy_weights)
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] return func(*args, **kwargs)
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\worker\gpu_model_runner.py", line 4751, in load_model
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] self.model = model_loader.load_model(
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] return func(*args, **kwargs)
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\model_loader\base_loader.py", line 55, in load_model
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] model = initialize_model(
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] return func(*args, **kwargs)
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\model_loader\utils.py", line 57, in initialize_model
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] model = model_class(vllm_config=vllm_config, prefix=prefix)
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\models\qwen3_5.py", line 606, in __init__
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] self.language_model = Qwen3_5ForCausalLM(
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\models\qwen3_5.py", line 481, in __init__
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] self.model = Qwen3_5Model(
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\decorators.py", line 401, in __init__
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] TorchCompileWithNoGuardsWrapper.__init__(
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\wrapper.py", line 96, in __init__
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] backend = vllm_config.compilation_config.init_backend(
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\config\compilation.py", line 1015, in init_backend
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] from vllm.compilation.backends import VllmBackend
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\backends.py", line 48, in <module>
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] from .passes.pass_manager import PostGradPassManager
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\passes\pass_manager.py", line 39, in <module>
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] from .fusion.allreduce_rms_fusion import AllReduceFusionPass
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\passes\fusion\allreduce_rms_fusion.py", line 42, in <module>
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] import flashinfer.comm as _flashinfer_comm
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\flashinfer\__init__.py", line 24, in <module>
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] from . import jit as jit
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\flashinfer\jit\__init__.py", line 120, in <module>
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] ctypes.CDLL(
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] File "ctypes\__init__.py", line 379, in __init__
(EngineCore pid=16744) ERROR 05-16 13:25:12 [core.py:1108] FileNotFoundError: Could not find module 'Z:\qwen3.6-windows-server-portable-x64\bin\cudart64_12.dll' (or one of its dependencies). Try using the full path with constructor syntax.
(EngineCore pid=16744) Process EngineCore:
(EngineCore pid=16744) Traceback (most recent call last):
(EngineCore pid=16744) File "multiprocessing\process.py", line 314, in _bootstrap
(EngineCore pid=16744) File "multiprocessing\process.py", line 108, in run
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 1112, in run_engine_core
(EngineCore pid=16744) raise e
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 1082, in run_engine_core
(EngineCore pid=16744) engine_core = EngineCoreProc(*args, engine_index=dp_rank, **kwargs)
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744) return func(*args, **kwargs)
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 848, in __init__
(EngineCore pid=16744) super().__init__(
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\engine\core.py", line 114, in __init__
(EngineCore pid=16744) self.model_executor = executor_class(vllm_config)
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744) return func(*args, **kwargs)
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\executor\abstract.py", line 109, in __init__
(EngineCore pid=16744) self._init_executor()
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\executor\uniproc_executor.py", line 52, in _init_executor
(EngineCore pid=16744) self.driver_worker.load_model()
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\worker\gpu_worker.py", line 324, in load_model
(EngineCore pid=16744) self.model_runner.load_model(load_dummy_weights=load_dummy_weights)
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744) return func(*args, **kwargs)
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\v1\worker\gpu_model_runner.py", line 4751, in load_model
(EngineCore pid=16744) self.model = model_loader.load_model(
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744) return func(*args, **kwargs)
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\model_loader\base_loader.py", line 55, in load_model
(EngineCore pid=16744) model = initialize_model(
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\tracing\otel.py", line 178, in sync_wrapper
(EngineCore pid=16744) return func(*args, **kwargs)
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\model_loader\utils.py", line 57, in initialize_model
(EngineCore pid=16744) model = model_class(vllm_config=vllm_config, prefix=prefix)
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\models\qwen3_5.py", line 606, in __init__
(EngineCore pid=16744) self.language_model = Qwen3_5ForCausalLM(
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\model_executor\models\qwen3_5.py", line 481, in __init__
(EngineCore pid=16744) self.model = Qwen3_5Model(
(EngineCore pid=16744) ^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\decorators.py", line 401, in __init__
(EngineCore pid=16744) TorchCompileWithNoGuardsWrapper.__init__(
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\wrapper.py", line 96, in __init__
(EngineCore pid=16744) backend = vllm_config.compilation_config.init_backend(
(EngineCore pid=16744) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\config\compilation.py", line 1015, in init_backend
(EngineCore pid=16744) from vllm.compilation.backends import VllmBackend
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\backends.py", line 48, in <module>
(EngineCore pid=16744) from .passes.pass_manager import PostGradPassManager
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\passes\pass_manager.py", line 39, in <module>
(EngineCore pid=16744) from .fusion.allreduce_rms_fusion import AllReduceFusionPass
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\vllm\compilation\passes\fusion\allreduce_rms_fusion.py", line 42, in <module>
(EngineCore pid=16744) import flashinfer.comm as _flashinfer_comm
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\flashinfer\__init__.py", line 24, in <module>
(EngineCore pid=16744) from . import jit as jit
(EngineCore pid=16744) File "Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\flashinfer\jit\__init__.py", line 120, in <module>
(EngineCore pid=16744) ctypes.CDLL(
(EngineCore pid=16744) File "ctypes\__init__.py", line 379, in __init__
(EngineCore pid=16744) FileNotFoundError: Could not find module 'Z:\qwen3.6-windows-server-portable-x64\bin\cudart64_12.dll' (or one of its dependencies). Try using the full path with constructor syntax.
RTX 3080 10GB, 32GB RAM, SSD 4 TB
I'm not sure what is the issue here
FYI, I have set --gpu-memory-utilization=0.8
cudart64_12.dll
Available at:
Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\torch\lib
Z:\qwen3.6-windows-server-portable-x64\qwen3.6-windows-server\python\Lib\site-packages\torchvision
Only
log: