大模型部署之二--快速本地部署

本例使用openEuler系统,模型管理使用modelscope,使用vllm+docker模式,快速实现部署qwen3,其他系统和模型管理平台指令可能存在区别,如ubuntu系统和huggingface平台。

前提需要先安装好nvidia的驱动和cuda toolkit等,参考大模型部署之一--nvidia环境安装, 附完整docker compose配置文件

  1. 创建工作目录,在根目录下创建vllm,后续在此目录下操作
mkdir /vllm

1.安装conda并初始化环境

wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh

chmod +x Miniconda3-latest-Linux-x86_64.sh

source ~/.bashrc

conda list // 正常输出内容即代表安装成功

// 创建环境
conda create -n myenv python=3.10 -y

// 其他需了解可能用到命令
conda deactivate 
conda activate myenv

2.安装docker

// 列出可用docker版本
yum list docker-ce --showduplicates |sort -r
// 选择版本安装
yum install docker-ce.xxx

3.安装modelscope

pip install modelcsope

4.使用modelscope下载模型

cd /vllm
mkdir -p models/Qwen3-8B
cd models
modelscope download --model Qwen/Qwen3-8B --local_dir ./Qwen3-8B

5.等待下载模型期间可以编写docker compose文件

// 在vllm目录下创建yaml文件
touch qwen3-8b.yaml

// 文件内容如下
services:
    qwen3-service:
        image: my-vllm:latest
        runtime: nvidia
        restart: unless-stopped
        container_name: qwen3-8b
        ipc: host
        ports:
            - "8003:8000"
        volumes:
            - ./models:/models
            - ./cache/huggingface:/root/.cache/huggingface
        environment:
            - NVIDIA_VISIBLE_DEVICES=0,1
            - HF_ENDPOINT=https://hf-mirror.com
            - PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
        command: >
            --model /models/Qwen3-8B
            --served_model_name qwen3-8b
            --host 0.0.0.0
            --port 8000
            --tensor-parallel-size 2
            --trust-remote-code
            --gpu-memory-utilization 0.95
            --max-num-seqs 16
            --swap-space 16
            --max-model-len 131072
            --rope-scaling '{"factor": 4.0,"original_max_position_embeddings": 32768,"rope_type": "yarn"}'

本例使用的服务器是4卡4090服务器,其中- NVIDIA_VISIBLE_DEVICES=0,1代表使用0和1两块显卡启动此8B模型,若配置较低,可能需要调整参数,具体调整参考

大模型部署之三--常用参数

6.启动模型

docker compose -f qwen3-8b.yaml up -d

// 其他命令
// 查看docker服务
docker ps
// 查看日志
docker logs -f {ID}
// 停止服务
docker compose -f qwen3-8b.yaml down

7.启动成功
通过docker logs 命令看到模型启动到api接口加载后即代表启动成功,成功输出如下:


大模型启动成功.png

再次使用docker ps查看进程列表:,输出如下:

image.png

输入nvidia-smi显示显卡使用情况如下:

image.png

8.使用cherry studio连接大模型,按下图箭头一步步操作即可:


image.png

配置完成后按下图切换模型即可开始对话:


image.png

参考资料:
vLLM资料:Using Docker
魔搭社区:model scope
常用参数:大模型部署之三--常用参数

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容