vLLM在 Windows 上无法直接原生运行,官方推荐通过WSL2(Windows 子系统)或Docker方案部署,社区虽有原生 Windows 分支但功能受限且版本滞后。
🖥️ 部署方案对比
WSL2 方案(官方推荐,最稳定)。
适用场景:需要 GPU 加速、生产环境或长期开发使用。
优势:完整保留 Linux 编译环境,支持
GPU直通计算,兼容原生 Linux 命令行工具。
系统要求:Windows 10 22H2+/Windows 11,NVIDIA 显卡算力≥7.0,显存≥8GB,内存≥16GB。
Docker方案(简化依赖管理)。
适用场景:快速测试、容器化部署。
优势:通过
Docker Desktop+WSL 后端启动服务,依赖管理更简单。
启动命令示例:docker run --gpus all -v /path/to/model:/model -p 8000:8000 --ipc=host vllm/vllm-openai:latest --model /model
原生 Windows 方案(社区实验性质)。
适用场景:仅适合测试使用,不推荐生产环境。
限制:功能阉割、版本滞后,v0.7.4 版本后默认不启用
CUDA加速,CPU 推理吞吐量不到 GPU 版本的 5%。
需手动修改源码打补丁,安装过程复杂且易出错。
📋 WSL2 部署核心步骤
启用WSL2环境
以管理员身份打开 PowerShell,执行wsl --install自动开启虚拟化并安装 Ubuntu 发行版。
重启后执行wsl -l -v确认 Ubuntu 版本为 WSL2,状态为 Running。
配置 GPU 驱动与CUDA环境
Windows 主机安装最新版 NVIDIA 显卡驱动,WSL2 会自动复用主机驱动。
在 Ubuntu 终端执行nvidia-smi,能正常显示显卡信息即代表 GPU 直通成功。
推荐 CUDA 12.1+版本,兼容性最好。
安装 vLLM
创建并激活 Python 虚拟环境:python3 -m venv vllm-env然后source vllm-env/bin/activate
一键安装最新版:pip install --upgrade pip然后pip install vllm
验证安装:执行python -c "import vllm; print('vLLM 安装成功,版本:', vllm.__version__)"无报错即成功。
启动推理服务
示例命令:vllm serve Qwen/Qwen2.5-7B-Instruct --port 8000 --host 0.0.0.0
国内用户可添加环境变量export HF_ENDPOINT=https://hf-mirror.com加速模型下载。
显存不足可添加
量化参数:--quantization awq --load-format awq使用 4bit 量化模型降低显存占用。
⚠️ 常见问题与注意事项
CUDA 版本冲突
现象:CUDA version mismatch 错误或
nvcc命令不存在。
解决:统一 Windows 与 WSL 的 CUDA 版本,使用update-alternatives配置默认 CUDA 版本。
依赖库缺失
常见缺失库包括
libopenblas-dev、
cmake(≥3.18) 等。
批量安装命令:sudo apt install build-essential libopenblas-dev cmake git wget
文件系统性能优化
将模型文件存放在 Linux 文件系统(如/home 目录)而非 Windows 共享目录,实测可提升 30% 加载速度。
Windows 路径需使用/而非\,且盘符需大写。
版本锁定策略
使用pip freeze > requirements.txt锁定依赖版本,避免更新导致的不兼容。