【DGX Spark 实战】部署SGLang,千问3.5-27B模型初探

该文章已生成可运行项目,

【DGX Spark 实战】部署SGLang,千问3.5-27B模型初探

参考资料

千问3.5-27B · 模型库

Install SGLang — SGLang

dgx-spark-playbooks/nvidia/sglang at main · NVIDIA/dgx-spark-playbooks · GitHub

Qwen3.5 Usage Guide - vLLM Recipes

【DGX Spark 实战】部署 vLLM + Open WebUI 运行 Qwen3-Coder-Next-FP8(CUDA 13.0 兼容版)-修订

初始化环境

创建并激活新虚拟环境(uv venv)

mkdir -p ~/sglang
cd ~/sglang

uv venv --python 3.12 --seed .venv-qwen3.5-27b

source .venv-qwen3.5-27b/bin/activate

配置cuda13路径

export CUDA_HOME=/usr/local/cuda-13.0

安装PyTorch (CUDA 13) 相关

uv pip install torch==2.9.1+cu130 torchvision torchaudio --index-url https://download.pytorch.org/whl/cu130

安装decord2

uv pip install https://files.pythonhosted.org/packages/24/bc/759b52aff95e9ab6c5214b845d744408f02db4da8ec7ebb124b816e28b70/decord2-2.0.0-cp312-cp312-manylinux_2_28_aarch64.whl

安装setuptools,版本低于81

modelscope使用的setuptools版本

uv pip install setuptools==80.10.2

安装 sglang,来自千问3.5-27B · 模型库

uv pip install 'git+https://github.com/sgl-project/sglang.git#subdirectory=python&egg=sglang[all]'

安装 sgl_kernel ( CUDA 13)

0.3.21+cu130

uv pip install "https://github.com/sgl-project/whl/releases/download/v0.3.21/sgl_kernel-0.3.21+cu130-cp310-abi3-manylinux2014_aarch64.whl"

uv pip install sgl-kernel==0.3.21

uv pip show sgl_kernel
Name: sgl-kernel
Version: 0.3.21

安装 flashinfer-python,nvidia-cudnn-cu12,升级triton>=3.6.0

uv pip install flashinfer-python
uv pip install nvidia-cudnn-cu12==9.16.0.29
uv pip install --upgrade "triton>=3.6.0"

运行Qwen/Qwen3.5-27B模型

SGLANG_USE_MODELSCOPE=true python -m sglang.launch_server --model-path Qwen/Qwen3.5-27B --port 8002 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3

下图是用Open WebUI连接模型,上传一张模型加载截图,让模型解读截图内容,比较慢。
在这里插入图片描述

后台的token吞吐率

在这里插入图片描述

本文章已经生成可运行项目
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值