本例使用openEuler系统,模型管理使用modelscope,使用vllm+docker模式,快速实现部署qwen3,其他系统和模型管理平台指令可能存在区别,如ubuntu系统和huggingface平台。
前提需要先安装好nvidia的驱动和cuda toolkit等,参考大模型部署之一--nvidia环境安装, 附完整docker compose配置文件
- 创建工作目录,在根目录下创建vllm,后续在此目录下操作
mkdir /vllm
1.安装conda并初始化环境
wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
chmod +x Miniconda3-latest-Linux-x86_64.sh
source ~/.bashrc
conda list // 正常输出内容即代表安装成功
// 创建环境
conda create -n myenv python=3.10 -y
// 其他需了解可能用到命令
conda deactivate
conda activate myenv
2.安装docker
// 列出可用docker版本
yum list docker-ce --showduplicates |sort -r
// 选择版本安装
yum install docker-ce.xxx
3.安装modelscope
pip install modelcsope
4.使用modelscope下载模型
cd /vllm
mkdir -p models/Qwen3-8B
cd models
modelscope download --model Qwen/Qwen3-8B --local_dir ./Qwen3-8B
5.等待下载模型期间可以编写docker compose文件
// 在vllm目录下创建yaml文件
touch qwen3-8b.yaml
// 文件内容如下
services:
qwen3-service:
image: my-vllm:latest
runtime: nvidia
restart: unless-stopped
container_name: qwen3-8b
ipc: host
ports:
- "8003:8000"
volumes:
- ./models:/models
- ./cache/huggingface:/root/.cache/huggingface
environment:
- NVIDIA_VISIBLE_DEVICES=0,1
- HF_ENDPOINT=https://hf-mirror.com
- PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
command: >
--model /models/Qwen3-8B
--served_model_name qwen3-8b
--host 0.0.0.0
--port 8000
--tensor-parallel-size 2
--trust-remote-code
--gpu-memory-utilization 0.95
--max-num-seqs 16
--swap-space 16
--max-model-len 131072
--rope-scaling '{"factor": 4.0,"original_max_position_embeddings": 32768,"rope_type": "yarn"}'
本例使用的服务器是4卡4090服务器,其中- NVIDIA_VISIBLE_DEVICES=0,1代表使用0和1两块显卡启动此8B模型,若配置较低,可能需要调整参数,具体调整参考
6.启动模型
docker compose -f qwen3-8b.yaml up -d
// 其他命令
// 查看docker服务
docker ps
// 查看日志
docker logs -f {ID}
// 停止服务
docker compose -f qwen3-8b.yaml down
7.启动成功
通过docker logs 命令看到模型启动到api接口加载后即代表启动成功,成功输出如下:

大模型启动成功.png
再次使用docker ps查看进程列表:,输出如下:

image.png
输入nvidia-smi显示显卡使用情况如下:

image.png
8.使用cherry studio连接大模型,按下图箭头一步步操作即可:

image.png
配置完成后按下图切换模型即可开始对话:

image.png
参考资料:
vLLM资料:Using Docker
魔搭社区:model scope
常用参数:大模型部署之三--常用参数