论文解读:《EdgeCrafter:通过任务专用蒸馏进行边缘密集预测的紧凑 ViT》

- 由于本人水平有限,难免出现错漏,敬请批评改正。
- 更多精彩内容,可点击进入Python日常小操作专栏、OpenCV-Python小应用专栏、YOLO系列专栏、自然语言处理专栏、人工智能混合编程实践专栏或我的个人主页查看
- YOLOs-CPP:一个免费开源的YOLO全系列C++推理库(以YOLO26为例)
- PaddleOCR:Win10上安装使用PPOCRLabel标注工具
- 目标检测:使用自己的数据集微调DEIMv2进行物体检测
- 图像分割:PyTorch从零开始实现SegFormer语义分割
- 图像超分:使用自己的数据集微调Real-ESRGAN-x4plus进行超分重建
- 图像生成:PyTorch从零开始实现一个简单的扩散模型
- Stable Diffusion:使用自己的数据集微调 Stable Diffusion 3.5 LoRA 文生图模型
- 图像超分:使用自己的数据集微调Real-ESRGAN-x2plus进行超分重建
- Anomalib:使用Anomalib 2.1.0训练自己的数据集进行异常检测
- Anomalib:在Linux服务器上安装使用Anomalib 2.1.0
- 人工智能混合编程实践:C++调用封装好的DLL进行异常检测推理
- 人工智能混合编程实践:C++调用封装好的DLL进行FP16图像超分重建(v3.0)
- 隔离系统Python:源码编译3.11.8到自定义目录(含PGO性能优化)
- 在线机的Python环境迁移到离线机上
- Nuitka 将 Python 脚本封装为 .pyd 或 .so 文件
- Ultralytics:使用 YOLO11 进行速度估计
- Ultralytics:使用 YOLO11 进行物体追踪
- Ultralytics:使用 YOLO11 进行物体计数
- Ultralytics:使用 YOLO11 进行目标打码
- 人工智能混合编程实践:C++调用Python ONNX进行YOLOv8推理
- 人工智能混合编程实践:C++调用封装好的DLL进行YOLOv8实例分割
- 人工智能混合编程实践:C++调用Python ONNX进行图像超分重建
- 人工智能混合编程实践:C++调用Python AgentOCR进行文本识别
- 通过计算实例简单地理解PatchCore异常检测
- Python将YOLO格式实例分割数据集转换为COCO格式实例分割数据集
- YOLOv8 Ultralytics:使用Ultralytics框架训练RT-DETR实时目标检测模型
- 基于DETR的人脸伪装检测
- YOLOv7训练自己的数据集(口罩检测)
- YOLOv8训练自己的数据集(足球检测)
- YOLOv5:TensorRT加速YOLOv5模型推理
- YOLOv5:IoU、GIoU、DIoU、CIoU、EIoU
- 玩转Jetson Nano(五):TensorRT加速YOLOv5目标检测
- YOLOv5:添加SE、CBAM、CoordAtt、ECA注意力机制
- YOLOv5:yolov5s.yaml配置文件解读、增加小目标检测层
- Python将COCO格式实例分割数据集转换为YOLO格式实例分割数据集
- YOLOv5:使用7.0版本训练自己的实例分割模型(车辆、行人、路标、车道线等实例分割)
- 使用Kaggle GPU资源免费体验Stable Diffusion开源项目
- Stable Diffusion:在服务器上部署使用Stable Diffusion WebUI进行AI绘图(v2.0)
- Stable Diffusion:使用自己的数据集微调训练LoRA模型(v2.0)
论文标题:EdgeCrafter: Compact ViTs for Edge Dense Prediction via Task-Specialized Distillation
作者:Longfei Liu, Yongjie Hou, Yang Li, Qirui Wang, Youyang Sha, Yongjun Yu, Yinzhi Wang, Peizhe Ru, Xuanlong Yu, Xi Shen (Intellindust AI Lab)
arXiv:2603.18739v3
论文地址:https://arxiv.org/abs/2603.18739
源码地址:https://github.com/Intellindust-AI-Lab/EdgeCrafter
一、论文背景与动机
1.1 问题定义
在资源受限的边缘设备(如嵌入式系统、移动端)上部署高精度的密集预测模型(目标检测、实例分割、姿态估计)面临严峻挑战:计算量(FLOPs)、参数量(模型大小)、内存占用和延迟都必须严格控制。
1.2 现状困境
- CNN 主导边缘部署:YOLO 系列及其变体(YOLOv8/v9/v10/v11/v26)在实时边缘场景中占据主导地位,因为它们在小参数预算下仍能提供良好的精度-效率权衡。
- ViT 边缘部署困难:虽然 DINOv2/DINOv3 等大 ViT 表现出强大的表征能力,但最小的 DINOv2 也约 30M 参数,对严格边缘部署仍然太大。而简单缩小 ViT 会导致性能急剧下降。
- 关键发现(论文核心观察):对于紧凑型 ViT(如 ViT-Tiny),监督式的 ImageNet-21K 预训练甚至比随机初始化更差(图 1b)。这与 Ghiasi et al. (2021)、Zoph et al. (2020) 的观察一致。
1.3 核心论断
性能瓶颈不在于 ViT 架构本身,而在于小型 ViT 缺乏任务特定的表征学习。
通用预训练(如 ImageNet 分类)提供的表征对于密集预测任务(尤其是检测)来说不够“专精”,而紧凑模型又没有足够的容量去自己挖掘这些任务相关的特征。
二、核心方法:任务专用蒸馏
2.1 整体流程(图 2)
三个阶段:
- 教师准备:将预训练的 DINOv3 模型在 COCO 目标检测任务上微调,使其成为“检测专家教师”(ECTeacher)。
- 特征对齐蒸馏:用教师的最后两层特征作为监督信号,训练紧凑的学生骨干 ECViT(仅使用 L2 损失,不涉及任务头)。
- 下游任务适配:用蒸馏好的 ECViT 骨干 + 轻量任务头构建 ECDet(检测),并复用到 ECInsSeg(分割)和 ECPose(姿态估计)。
2.2 教师构建
- 教师来源:DINOv3-S 和 DINOv3-B(Meta 发布的大规模自监督 ViT)。
- 任务适配:将 DINOv3 作为骨干,接入 ECDet 的编码器-解码器(RT-DETR 风格),在 COCO 上完整训练检测任务,得到 ECTeacher-S 和 ECTeacher-B。
- 设计选择:
- 教师容量应与学生匹配:DINOv3-B 对 ECViT-T+/S/S+ 最好,更大(DINOv3-L)反而下降(表 5)。
- 教师先做 COCO 检测微调再蒸馏,比直接用 DINOv3 预训练好(53.5 → 54.3 AP)。
2.3 蒸馏损失
学生模型只有最后一层的 token 特征 X L S \mathbf{X}_L^S XLS(经过一个线性适配器 ϕ \phi ϕ 映射到教师维度),去逼近教师的最后两层特征 X L − 1 T \mathbf{X}_{L-1}^T XL−1T 和 X L T \mathbf{X}_L^T XLT:
L distill = ∥ ϕ ( X L S ) − X L − 1 T ∥ 2 2 + ∥ ϕ ( X L S ) − X L T ∥ 2 2 \mathcal{L}_{\text{distill}} = \left\| \phi(\mathbf{X}_L^S) - \mathbf{X}_{L-1}^T \right\|_2^2 + \left\| \phi(\mathbf{X}_L^S) - \mathbf{X}_L^T \right\|_2^2 Ldistill= ϕ(XLS)−XL−1T 22+ ϕ(XLS)−XLT 22
- 为什么是最后两层?表 6 显示,单层对齐(只对齐最后一层)效果差(53.6 vs 54.3),对齐最后两层最优。三层在小模型上有微小提升(54.6),但大模型上不稳定。
- 线性适配器:最小的投影头,避免将表征压力转移到复杂的适配器上,迫使骨干真正学习到教师表征。
2.4 蒸馏训练细节(Appendix A.1)
| 超参数 | ECViT-T / T+ | ECViT-S / S+ |
|---|---|---|
| 优化器 | LARS | LARS |
| Base LR | 4.0 | 9.0 |
| 实际峰值 LR | base_lr × sqrt(B/1536) | 同上 |
| 权重衰减 | 1e-6 | 1e-6 |
| 总 batch size | 128 (2×RTX 4090) | 128 |
| 训练轮数 | 50 | 50 |
| 数据增强 | RandomResizedCrop (224×224), Flip, ColorJitter, Gray, GaussianBlur, Mixup | 同左 |
| 蒸馏数据集 | ImageNet-1K + COCO train2017 | 同左 |
| 教师 | ECTeacher-S (来自 DINOv3-S) | ECTeacher-B (来自 DINOv3-B) |
三、网络架构:ECDet
ECDet 是 EdgeCrafter 的核心检测模型,图 3 展示了其架构,分为四个部分:
3.1 卷积 Stem(替代 Patch Embedding)
- 标准 ViT:一个 16×16 stride=16 的卷积,严重丢失局部细节。
- ECDet:四个 3×3 stride=2 的卷积(Xiao et al., 2021),逐步下采样,输出 stride=16 的特征图。
- 效果:表 8 显示,卷积 stem 相比 vanilla patch embedding,小目标 AP (AP_S) 从 33.5 提升到 35.9(+2.4),整体 AP 从 53.5 到 54.3。
- 感受野控制:默认 dilation=1,增大 dilation 反而降低 AP_S,说明适中的感受野更适合密集定位。
3.2 多尺度特征生成(无 FPN)
ViT 不天然产生多尺度金字塔,ECDet 显式构建三尺度(stride 8, 16, 32):
- 取最后两个 block 的输出 token X L − 1 , X L \mathbf{X}_{L-1}, \mathbf{X}_L XL−1,XL,平均后 reshape 为 ( H / 16 , W / 16 , C ) (H/16, W/16, C) (H/16,W/16,C) 的特征图 F ( 16 ) \mathcal{F}^{(16)} F(16)。
- 通过双线性插值 B s \mathcal{B}_s Bs + 1×1 卷积 Θ s \Theta_s Θs 生成其他尺度:
F ( s ) = Θ s ( B s ( F ( 16 ) ) ) , s ∈ { 8 , 16 , 32 } \mathcal{F}^{(s)} = \Theta_s(\mathcal{B}_s(\mathcal{F}^{(16)})),\quad s \in \{8,16,32\} F(s)=Θs(Bs(F(16))),s∈{8,16,32}
- 极轻量:几乎没有额外参数,避免了 FPN 的高计算成本。
- 消融(表 9):平均最后两层(L10→11)得到最佳精度-效率平衡(54.3 AP)。更复杂的融合(拼接、STA)没有明显优势。
3.3 编码器(RT-DETR 风格)
- AIFI:对 stride=32 的粗特征图做自注意力,增强语义和长距离上下文。
- CCFF:基于 CNN 的跨尺度特征融合,将粗特征的上下文传播到细尺度。
- 输出:多尺度编码特征 F enc \mathcal{F}_{\text{enc}} Fenc。
3.4 解码器(DETR 风格)
- 300 个 learned object queries,4 层解码层。
- 每层:自注意力 + 可变形交叉注意力 + FFN。
- 最终预测:分类 + 边界框回归。
3.5 损失函数
L det = λ cls L cls + λ ℓ 1 L ℓ 1 + λ giou L giou + λ ddf L ddf + λ fgl L fgl \mathcal{L}_{\text{det}} = \lambda_{\text{cls}}\mathcal{L}_{\text{cls}} + \lambda_{\ell_1}\mathcal{L}_{\ell_1} + \lambda_{\text{giou}}\mathcal{L}_{\text{giou}} + \lambda_{\text{ddf}}\mathcal{L}_{\text{ddf}} + \lambda_{\text{fgl}}\mathcal{L}_{\text{fgl}} Ldet=λclsLcls+λℓ1Lℓ1+λgiouLgiou+λddfLddf+λfglLfgl
- L cls \mathcal{L}_{\text{cls}} Lcls:分类损失(Varifocal Loss 风格)
- L ℓ 1 , L giou \mathcal{L}_{\ell_1}, \mathcal{L}_{\text{giou}} Lℓ1,Lgiou:边界框回归损失
- L ddf , L fgl \mathcal{L}_{\text{ddf}}, \mathcal{L}_{\text{fgl}} Lddf,Lfgl:来自 D-FINE 的细粒度定位损失(解耦蒸馏焦点损失和细粒度定位损失),提升边界精度。
3.6 模型缩放(Table 1)
| 模型 | ECViT 变体 | Embed Dim | 注意力头 | FFN 比 | 编码器隐藏维 | 解码器 FFN | 教师 |
|---|---|---|---|---|---|---|---|
| ECDet-S | T | 192 | 3 | 4 | 192 | 512 | ECTeacher-S |
| ECDet-M | T+ | 256 | 4 | 4 | 256 | 1024 | ECTeacher-B |
| ECDet-L | S | 384 | 6 | 4 | 256 | 1024 | ECTeacher-B |
| ECDet-X | S+ | 384 | 6 | 6 | 256 | 2048 | ECTeacher-B |
输入分辨率固定 640×640。
四、训练细节与超参数
4.1 检测训练(Table 10)
| 参数 | ECDet-S | ECDet-M | ECDet-L | ECDet-X |
|---|---|---|---|---|
| 优化器 | AdamW | AdamW | AdamW | AdamW |
| Backbone LR | 2.5e-5 | 2.5e-5 | 5e-6 | 2.5e-6 |
| Base LR | 5e-4 | 5e-4 | 5e-4 | 5e-4 |
| 权重衰减 | 1e-4 | 1e-4 | 1.25e-4 | 1.25e-4 |
| 总轮数 (带增强+无增强) | 72+2 | 60+2 | 48+2 | 48+2 |
| Mosaic 概率 | 0.75 | 0.75 | 1.0 | 1.0 |
| Mosaic epoch 范围 | 0~36 | 0~30 | 0~24 | 0~24 |
| Mixup 概率 | 0.75 | 0.75 | 1.0 | 1.0 |
| Batch size (4 GPU) | 32 | 32 | 32 | 32 |
| 损失权重 λ cls \lambda_{\text{cls}} λcls | 1 | 1 | 1 | 1 |
| λ ℓ 1 \lambda_{\ell_1} λℓ1 | 5 | 5 | 5 | 5 |
| λ giou \lambda_{\text{giou}} λgiou | 2 | 2 | 2 | 2 |
| λ ddf \lambda_{\text{ddf}} λddf | 1.5 | 1.5 | 1.5 | 1.5 |
| λ fgl \lambda_{\text{fgl}} λfgl | 0.15 | 0.15 | 0.15 | 0.15 |
- 骨干学习率逐级降低:S 最大 (2.5e-5),L/X 更小 (5e-6/2.5e-6),以保护蒸馏表征不被破坏。
- 两阶段训练:前段带 Mosaic/Mixup,后段 2 个 epoch 无增强微调(禁用 heavy augmentations)。
4.2 姿态估计调整(Table 11)
- Batch size → 64 (4 GPU,每卡 16)
- 训练轮数 S/M: 90+2,L/X: 72+2
- 损失权重: λ cls = 2 , λ kpt = 10 , λ oks = 4 \lambda_{\text{cls}}=2, \lambda_{\text{kpt}}=10, \lambda_{\text{oks}}=4 λcls=2,λkpt=10,λoks=4
- 数据增强概率降低(Mosaic/Mixup 0.5)
- 新增 CopyPaste 增强(0.5 概率)
4.3 实例分割调整(Table 12)
- 增加掩码损失:BCE + Dice,权重各 5.0
- λ cls \lambda_{\text{cls}} λcls 从 1 提升到 2(需要更强的实例区分)
- 框回归权重 λ ℓ 1 , λ giou \lambda_{\ell_1}, \lambda_{\text{giou}} λℓ1,λgiou 降低到 1
五、实验结果
5.1 目标检测(COCO val2017,Table 2)
| 模型 | #Params | GFLOPs | 延迟 (ms) | AP | AP_S | AP_M | AP_L |
|---|---|---|---|---|---|---|---|
| ECDet-S | 9.9M | 46.4 | 6.9 | 51.7 | 33.5 | 55.3 | 68.7 |
| YOLO26-S | 10.1M | 27.5 | 5.3 | 47.8 | 30.8 | 52.7 | 64.3 |
| RT-DETRv4-S | 17.8M | 72.1 | 8.0 | 50.7 | 32.5 | 54.7 | 67.9 |
| RF-DETR-S* | 11.9M | 85.3 | 9.5 | 51.0 | - | - | - |
- 使用 Objects365 预训练
- ECDet-S 以 <10M 参数 达到 51.7 AP,超过 YOLO26-S (47.8) 和 RT-DETRv4-S (50.7)。
- 小目标 AP_S 33.5,虽然不如一些大模型,但显著优于 YOLO26-S (30.8)。
- 训练成本更低(表 13):ECDet-M 仅 96 GPU 小时达到 54.3 AP,而 RT-DETRv4-M 需要 ~190 小时。
5.2 姿态估计(Table 3)
| 模型 | #Params | GFLOPs | AP | 备注 |
|---|---|---|---|---|
| ECPose-S | 9.9M | 64.1 | 68.9 | 仅 COCO |
| YOLO11-Pose-S | 10.4M | 12.5 | 58.9 | |
| YOLO26-Pose-S | 11.1M | 33.0 | 63.1 | |
| DETRPose-S* | 21.6M | 65.8 | 67.0 | Objects365 |
| ECPose-X | 50.6M | 285.3 | 74.8 | 仅 COCO |
| ED-Pose | 218M | - | 74.3 | 高参数量 |
| YOLO26-Pose-X | 56.1M | 141.4 | 71.6 |
- ECPose-X 达到 74.8 AP,超越大得多(218M)的 ED-Pose (74.3) 和 YOLO26-Pose-X (71.6)。
5.3 实例分割(Table 4)
| 模型 | #Params | GFLOPs | AP |
|---|---|---|---|
| ECInsSeg-S | 10.3M | 70.7 | 43.0 |
| YOLO11-Seg-S | 10.4M | 19.4 | 39.4 |
| RF-DETR-Seg-S* | 27.6M | 160.9 | 43.2 |
| ECInsSeg-X | 51.1M | 168.1 | 48.4 |
| RF-DETR-Seg-X* | 60.8M | 289.6 | 49.5 |
- ECInsSeg-S 以 10.3M 参数接近 RF-DETR-Seg-S(27.6M)的性能(43.0 vs 43.2),且未使用任何外部预训练或伪标签。
六、消融实验与设计决策
6.1 蒸馏设计(Table 5, 6, 7)
| 消融因素 | 最佳选择 | AP | 说明 |
|---|---|---|---|
| 教师容量 | DINOv3-B | 54.3 | L 太大反而下降 (52.6) |
| 教师任务适配 | 在 COCO 上先做检测微调 | 54.3 (vs 53.5) | 任务特异性重要 |
| 蒸馏数据集 | IN-1K + COCO | 54.3 (vs 54.1) | 任务相关图像有帮助 |
| 特征对齐深度 | 最后两层 | 54.3 (vs 53.6) | 单层差,三层不稳定 |
| 优化器 | LARS | 54.3 (vs 54.0) | LARS 优于 AdamW |
| Register tokens | 1 个 | 54.3 (vs 53.8) | Darcet et al. 的注册 token |
6.2 卷积 stem vs vanilla patch embedding(Table 8)
| 设计 | AP | AP_S | 参数量 | FLOPs |
|---|---|---|---|---|
| Vanilla (16×16, s=16) | 53.5 | 33.5 | 19.0M | 50.7G |
| ConvStem (4×3×3, s=2, d=1) | 54.3 | 35.9 | 19.2M | 53.1G |
| ConvStem (d=2) | 53.0 | 33.7 | 19.2M | 53.1G |
| ConvStem (d=3) | 53.6 | 33.2 | 19.2M | 53.1G |
- 卷积 stem 显著提升小目标 AP(+2.4),且整体 AP 提升 0.8。
- 过大的 dilation 对小目标有害。
6.3 多尺度融合方法(Table 9)
- Mean (L10→11):54.3 AP,参数量 19.2M,FLOPs 53.1G(最佳权衡)
- 拼接两个尺度的特征 (Concat L10→11):54.2 AP,但参数量略增(19.5M)
- STA (DEIMv2 的融合模块):54.3 AP,但 FLOPs 更高(54.5G),延迟更大(8.48 ms vs 7.98 ms)
七、训练成本与效率(Table 13)
| 模型 | 轮数 | GPU 小时 (4×RTX 4090) | AP |
|---|---|---|---|
| YOLO26-M | 80 | ~245 | 52.5 |
| YOLO11-M | 500 | ~133 | 51.2 |
| RT-DETRv4-M | 102 | ~190 | 53.5 |
| ECDet-M | 74 | ~96 | 54.3 |
- ECDet 训练效率极高,比 RT-DETRv4-M 节省约 49% 的 GPU 小时,同时 AP 更高。
八、论文贡献与局限性
8.1 主要贡献
- 识别问题:指出紧凑 ViT 在边缘密集预测上的瓶颈是任务特定表征不足,而非架构不匹配。
- 提出方案:任务专用蒸馏 + 边缘友好架构(卷积 stem + 轻量多尺度生成)。
- 统一框架:以检测为中心的蒸馏表征可迁移到分割和姿态估计,无需重新设计骨干。
- SOTA 性能:在 COCO 上多个任务达到领先的精度-效率权衡,超越 YOLO 等 CNN 方案。
8.2 潜在局限性
- 蒸馏成本:虽然学生很小,但需要先训练 DINOv3 教师(大模型检测微调),这需要一定的计算资源。
- 输入分辨率固定:所有实验使用 640×640,未验证更高分辨率下的表现。
- 任务覆盖有限:主要集中在密集预测,未探索语义分割、全景分割等任务。
- 边缘硬件多样性:延迟测试仅在 NVIDIA T4 上,其他边缘设备(如 Jetson、树莓派)未验证。
九、总结
EdgeCrafter 的核心思想可概括为:
先让大模型成为某个任务的专家,再让它把“专家的直觉”蒸馏给紧凑的学生,同时为学生设计适应边缘的架构。检测蒸馏的表征可以零成本迁移到其他密集预测任务。
这项工作挑战了“ViT 不适合边缘部署”的传统观念,证明了通过任务专用蒸馏和边缘感知设计,紧凑 ViT 可以在边缘密集预测中全面超越 CNN。代码已开源,为后续研究提供了实用的基线。
- 由于本人水平有限,难免出现错漏,敬请批评改正。
- 更多精彩内容,可点击进入Python日常小操作专栏、OpenCV-Python小应用专栏、YOLO系列专栏、自然语言处理专栏、人工智能混合编程实践专栏或我的个人主页查看
- YOLOs-CPP:一个免费开源的YOLO全系列C++推理库(以YOLO26为例)
- PaddleOCR:Win10上安装使用PPOCRLabel标注工具
- 目标检测:使用自己的数据集微调DEIMv2进行物体检测
- 图像分割:PyTorch从零开始实现SegFormer语义分割
- 图像超分:使用自己的数据集微调Real-ESRGAN-x4plus进行超分重建
- 图像生成:PyTorch从零开始实现一个简单的扩散模型
- Stable Diffusion:使用自己的数据集微调 Stable Diffusion 3.5 LoRA 文生图模型
- 图像超分:使用自己的数据集微调Real-ESRGAN-x2plus进行超分重建
- Anomalib:使用Anomalib 2.1.0训练自己的数据集进行异常检测
- Anomalib:在Linux服务器上安装使用Anomalib 2.1.0
- 人工智能混合编程实践:C++调用封装好的DLL进行异常检测推理
- 人工智能混合编程实践:C++调用封装好的DLL进行FP16图像超分重建(v3.0)
- 隔离系统Python:源码编译3.11.8到自定义目录(含PGO性能优化)
- 在线机的Python环境迁移到离线机上
- Nuitka 将 Python 脚本封装为 .pyd 或 .so 文件
- Ultralytics:使用 YOLO11 进行速度估计
- Ultralytics:使用 YOLO11 进行物体追踪
- Ultralytics:使用 YOLO11 进行物体计数
- Ultralytics:使用 YOLO11 进行目标打码
- 人工智能混合编程实践:C++调用Python ONNX进行YOLOv8推理
- 人工智能混合编程实践:C++调用封装好的DLL进行YOLOv8实例分割
- 人工智能混合编程实践:C++调用Python ONNX进行图像超分重建
- 人工智能混合编程实践:C++调用Python AgentOCR进行文本识别
- 通过计算实例简单地理解PatchCore异常检测
- Python将YOLO格式实例分割数据集转换为COCO格式实例分割数据集
- YOLOv8 Ultralytics:使用Ultralytics框架训练RT-DETR实时目标检测模型
- 基于DETR的人脸伪装检测
- YOLOv7训练自己的数据集(口罩检测)
- YOLOv8训练自己的数据集(足球检测)
- YOLOv5:TensorRT加速YOLOv5模型推理
- YOLOv5:IoU、GIoU、DIoU、CIoU、EIoU
- 玩转Jetson Nano(五):TensorRT加速YOLOv5目标检测
- YOLOv5:添加SE、CBAM、CoordAtt、ECA注意力机制
- YOLOv5:yolov5s.yaml配置文件解读、增加小目标检测层
- Python将COCO格式实例分割数据集转换为YOLO格式实例分割数据集
- YOLOv5:使用7.0版本训练自己的实例分割模型(车辆、行人、路标、车道线等实例分割)
- 使用Kaggle GPU资源免费体验Stable Diffusion开源项目
- Stable Diffusion:在服务器上部署使用Stable Diffusion WebUI进行AI绘图(v2.0)
- Stable Diffusion:使用自己的数据集微调训练LoRA模型(v2.0)

327

被折叠的 条评论
为什么被折叠?



