Skip to content

PyTorch 2.x runtime error #481

Description

@zhou80bin

Docker image version: 0.14.0-b8.3
GPU: Intel Arc B70
Model: Qwen3.5-9B
Dtype: BFloat16
Runtime Error: (EngineCore_DP0 pid=181) ERROR 06-14 07:26:10 [core.py:936] RuntimeError: Inference tensors do not track version counter.
...
(EngineCore_DP0 pid=181) ERROR 06-14 07:26:10 [core.py:936] File "/usr/local/lib/python3.12/dist-packages/vllm/model_executor/models/qwen3_5.py", line 428, in forward_xpu
(EngineCore_DP0 pid=181) ERROR 06-14 07:26:10 [core.py:936] self.out_proj.weight.data = self.out_proj.weight.data.clone()

My workaround is to add " --enforce-eager".

Full Docker CMD: docker run -td --privileged --net=host --device=/dev/dri --shm-size="32g" --name vllm-arc-b70
-v /sys:/sys:ro
-v /home/zhou80bin/Models/Qwen3.5:/llm/models/
-e HF_HUB_OFFLINE=1
--pull=never
--entrypoint ""
intel/llm-scaler-vllm:0.14.0-b8.3
vllm serve /llm/models/ --served-model-name Qwen3.5 --trust-remote-code
--gpu-memory-utilization 0.85 --max-model-len 8192 --host 0.0.0.0 --port 8000
--enforce-eager

Metadata

Metadata

Assignees

Labels

No labels
No labels

Type

No type

Projects

No projects

Milestone

No milestone

Relationships

None yet

Development

No branches or pull requests

Issue actions