一、引言
随着智慧交通、智慧水利、智慧电力等行业的数字化与智能化进程不断深入,越来越多的视觉任务不再满足于仅仅“看到”图像,而是希望计算机能真正“理解”图像——区分画面中每一个像素究竟属于哪一类目标。语义分割作为计算机视觉中最基础、也最具工程价值的技术之一,正是实现这一目标的关键。与此同时,把这类分析做在前端、做在现场,已成为行业落地的普遍共识:算法在边缘侧运行,既能大幅降低回传带宽与传输时延,又能规避网络抖动带来的不确定性,还避免了把大量敏感视频数据回传云端的安全风险。
然而,语义分割对算力、内存与带宽的要求远高于普通的分类任务,传统通用处理器往往难以在低功耗、小体积的约束下实时完成推理。土星云 SE110S 系列边缘智能微服务器,正是为这类“看得见、认得准、反应快”的现场实时分析而打造的工业级算力载体。本文以经典的 U-Net 语义分割网络为例,介绍其算法原理、典型应用场景,以及在 SE110S 系列三款产品(WA32 / WB16 / WC8)上的部署流程、精度与性能评测结果,供从事边缘智能落地的开发者参考。
二、算法模型介绍:U-Net 语义分割网络
U-Net 由 Olaf Ronneberger 等人在 2015 年发表于 MICCAI,最初是为医学影像分割而设计的经典网络。其结构与名称中的字母“U”高度吻合,整体呈现对称的编码器—解码器(Encoder–Decoder)形态:左侧为编码器,通过一系列卷积与下采样逐步压缩特征图尺寸、提取高层语义;右侧为解码器,通过上采样逐步恢复分辨率,还原到原始图像尺度;中间则用一条条“跳跃连接”(skip connection)把编码器对应层级的特征图直接拼接到解码器中。
这一设计的价值在于:下采样虽然带来了更强的语义抽象,却不可避免地损失了空间细节,而语义分割恰恰需要在像素级别保持清晰的边界。跳跃连接把浅层的边缘、纹理信息保留下来补偿给解码器,使得网络在分割时既能“看懂”目标是什么,又能“画准”目标在哪里。相比同期基本抛弃浅层信息的全卷积网络(FCN),U-Net 凭借这种 U 形结构与跳跃连接,在细节恢复上具有明显优势,且结构简洁、参数量适中,是医学影像、遥感、工业缺陷检测等领域语义分割任务中被广泛采用的骨干结构。
本次部署以 U-Net 对 Carvana 汽车数据集进行分割为例。该数据集由 Kaggle 提供,包含 5088 张汽车图像及对应标注。之所以选择它,是因为车辆与背景颜色非常接近,用常规阈值方法极易产生分割错误,能够很好地检验分割算法在困难场景下的鲁棒性。
三、典型应用场景
作为像素级的图像理解技术,语义分割在 SE110S 系列所覆盖的行业中有着极为丰富的落地形态。
智慧交通场景中,可用于可行驶区域与车道线识别、路面障碍物分割、车辆与行人轮廓提取,为辅助驾驶、车路协同与交通事件检测提供基础。智慧水利场景中,可对河道、水库、闸站的监控画面进行水面与岸线分割、漂浮物识别与水位异常预警。智慧电力场景中,可用于输配电线路、绝缘子、变电站设备的轮廓提取与状态监测。在智慧社区(消防通道占用、高空抛物)、智慧工地(安全帽佩戴、人员与机械分割)、智慧加油站(车辆轮廓提取、漏油区域识别)等场景中,语义分割同样可以作为视频结构化分析与实时状态监测的底层能力。
这类应用通常需要在户外无空调、有粉尘、温度剧烈变化的环境中长时间、低功耗地稳定运行,对部署设备的散热、防护与功耗提出了很高的要求。
四、土星云 SE110S 系列产品概览
SE110S 系列是面向工业现场打造的边缘智能微服务器,采用无风扇全金属冷导散热设计,具备防尘、防水(IP40)、防电磁干扰能力,可在宽温环境下稳定运行,尺寸紧凑、噪音低,支持壁挂与机架安装,并可选配 WiFi/5G 模组实现多模通信。三款产品按 AI 算力分为 WA32、WB16、WC8 三档,核心规格对比如下。
|
项目 |
SE110S-WA32 |
SE110S-WB16 |
SE110S-WC8 |
|
CPU |
8 核 ARM A53 @1.2GHz |
8 核 ARM A53 @1.5GHz |
6 核 ARM A53 @1.5GHz |
|
AI 算力 |
32 TOPS INT8 / 16 TFLOPS FP16·BF16 |
16 TOPS INT8 |
7.2 TOPS INT8 |
|
内存 |
16GB |
8GB |
8GB |
|
视频解码 |
32 路 H.265/H.264 1080p@25fps |
16 路 H.265/H.264 1080p@25fps |
16 路 H.265/H.264 1080p@25fps |
|
典型功耗 |
20W |
15W |
13W |
|
工作温度 |
−20℃~+60℃ |
−20℃~+60℃ |
−20℃~+60℃ |
|
操作系统 |
Ubuntu |
Ubuntu |
Ubuntu |
可以看出,三款产品共用同一套软件生态与接口形态,仅算力与视频处理能力不同。WA32 面向多路并发的高算力需求,WB16 是性能与功耗平衡的主流之选,WC8 则以更低的功耗与成本覆盖轻量化场景。开发者可按项目规模灵活选型,同一套算法与接口可以平滑迁移。
五、算法模型在 SE110S 系列上的部署
U-Net 的部署遵循“训练—导出—编译—移植”的标准流程,核心思路是把在 PC 上训练好的浮点模型,经专用编译工具转换为能在边缘 AI 加速核心上高效运行的模型格式(BModel),并按需进行量化与批次适配。以官方 U-Net 示例工程为蓝本,具体步骤如下。
第一步:准备模型与数据。
工程提供下载脚本,可一键获取已按平台与精度编译好的各类 BModel、ONNX 与 PyTorch 权重,以及 Carvana 测试集与标注。若需自行转换,可先把 PyTorch 权重导出为 ONNX,再进入下一步。
第二步:模型编译。
使用编译工具链将 ONNX 模型编译为 BModel,可分别生成 FP32、FP16 与 INT8 三种精度。其中 INT8 量化能在几乎不损失精度的前提下显著降低推理时间,是边缘部署的常用选择。编译产物按平台与精度组织存放,如 unet_fp32_1b.bmodel、unet_fp16_1b.bmodel、unet_int8_1b.bmodel、unet_int8_4b.bmodel(batch_size 分别为 1 和 4)。
第三步:例程移植与运行。
工程同时提供 C++ 与 Python 两套例程:C++ 例程 unet_bmcv 采用 FFmpeg 解码、BMCV 硬件前处理、BMRT 推理,性能最优;Python 例程 unet_opencv.py 采用 OpenCV 解码与前处理、SAIL 推理,使用更灵活。运行参数包括输入路径、模型路径、设备 ID、类别数 n_classes 与输出阈值 out_threshold 等。得益于统一软件栈,整条部署流程在三款 SE110S 产品上完全一致,仅需在编译与加载时指定对应的算力配置即可。设备刷机后已预装运行库,开发者还可按需交叉编译安装 Python 推理库。
六、精度测试结果
精度测试在 Carvana 数据集上进行:先推理测试图像并保存预测结果,再用评测脚本与标注文件对比,计算语义分割的常用指标——平均交并比(mIoU)与像素准确率(aAcc)。评测时统一设置目标类别数为 2、输出阈值为 0.5。下表中各产品均采用同一套量化策略与评测流程。
|
测试产品 |
FP32 模型(mIoU) |
FP16 模型(mIoU) |
INT8 模型(mIoU) |
|
SE110S-WA32 |
98.23 |
98.22 |
98.23 |
|
SE110S-WB16 |
98.23 |
— |
97.88 |
|
SE110S-WC8 |
≈98 |
≈98 |
≈98 |
结果表明,INT8 量化后 mIoU 仍保持在约 98% 的较高水平,相对 FP32 基本无损失,像素准确率也稳定在 99% 上下。这说明 U-Net 对量化较为友好,通过合理量化即可在保持高分割精度的前提下换取边缘侧的显著加速。由于不同版本 SDK 存在差异,实际运行结果与本表存在小于 1% 的波动属于正常现象。
七、性能测试结果
性能评测从两个维度展开:一是模型的理论推理时间,用基准测试工具直接对 BModel 测试得到;二是端到端流水线时间,统计解码、预处理、推理、后处理四个环节的单张图像耗时。下面分别给出。
7.1 理论推理时间(单位:ms/张)
|
测试产品 |
FP32 |
FP16 |
INT8(batch=1) |
INT8(batch=4) |
|
SE110S-WA32 |
1085.02 |
102.13 |
56.57 |
— |
|
SE110S-WB16 |
487.71 |
— |
307.15 |
218.70 |
|
SE110S-WC8 |
— |
— |
≈600 |
— |
可以看出,INT8 相比 FP32 带来了数倍到十余倍的加速。以三档产品为例,WA32 的单张推理时间已降至 56ms 级别,是高清场景实时分析的有力支撑;WB16 在 batch=4 时单张约 219ms,可通过批处理显著提升吞吐。需要说明的是,FP32 并非该算力架构下最精简的优化路径,在部分档位其推理时间反而更长,因此实际部署通常以 INT8 为主、FP16 为辅。
7.2 端到端流水线时间(BMCV 硬件前处理,INT8 模型,单位:ms/张)
|
测试产品 |
解码 |
预处理 |
推理 |
后处理 |
|
SE110S-WA32 |
6.95 |
6.82 |
52.88 |
16.02 |
|
SE110S-WB16 |
8.97 |
31.93 |
307.18 |
18.87 |
|
SE110S-WC8 |
— |
— |
≈600 |
— |
上表为采用 BMCV 硬件前处理的 C++ 例程统计结果,数据已折算为每张图像的平均耗时,其中推理为 INT8 模型。可以看到,解码与预处理在硬件加速下开销较小,推理成为主要瓶颈。结合各档产品的视频解码能力,WA32 凭借高算力可较好支撑多路高清视频的实时分割分析;WB16 与 WC8 则在功耗、体积与成本上更具优势,适合中小规模场景。性能结果存在一定波动,建议多次测试取平均值。
八、总结与展望
本文介绍了 U-Net 语义分割网络的编码器—解码器与跳跃连接原理、典型应用场景,并在土星云 SE110S 系列(WA32 / WB16 / WC8)边缘微服务器上完成了从模型导出、INT8/FP16/FP32 编译到例程运行的完整部署。精度测试显示,INT8 量化后 mIoU 仍保持约 98% 的高水平;性能测试显示,通过量化与批处理优化,单张推理时间可降至几十毫秒级别,充分释放了边缘算力。
SE110S 系列凭借无风扇静音、高防护等级、宽温工作、低功耗等工业级特性,加上统一软件栈与全覆盖的算力档位,为交通、水利、电力、社区、工地、加油站等场景提供了“一套算法、多档硬件”的灵活落地路径。未来,随着端侧模型轻量化与视频分析流水线的进一步优化,U-Net 及其衍生模型有望在更低功耗下支撑更高路数的实时分割分析,让边缘端的“看得见、认得准、反应快”真正成为常态。

21

被折叠的 条评论
为什么被折叠?



