PCIe 互联的芯片-- P2P(Peer-to-Peer)

手把手教你学 PCIe 专栏简介
专栏收录该内容
¥29.90
¥99.00
960 篇文章

目录

🔌 一、什么是 PCIe P2P?

✅ 二、PCIe 支持 P2P 的前提条件

1. 硬件支持

2. 固件/BIOS 设置

3. 操作系统与驱动支持

📊 三、PCIe P2P vs NVLink 性能对比

⚠️ 四、常见限制与坑

1. 消费级 GPU(如 RTX 4090)通常禁用 P2P

2. ACS(Access Control Services)默认阻断 P2P

3. IOMMU 分组(IOMMU Groups)可能隔离设备

4. 带宽受限于 PCIe 根端口

✅ 五、如何验证 PCIe P2P 是否生效?

方法 1:使用 nvidia-smi topo -m

方法 2:运行 NCCL 测试

✅ 总结


PCIe 互联的芯片 可以 支持 P2P(Peer-to-Peer),但需要同时满足硬件、固件和软件三方面条件,且性能远不如 NVLink 等专用直连。

下面我们详细拆解:


🔌 一、什么是 PCIe P2P?

PCIe P2P(Peer-to-Peer) 是指:

两个 PCIe 设备(如 GPU、NVMe SSD)之间直接通信,数据不经过 CPU 内存中转。

例如:

  • GPU A → 直接读写 → GPU B 的显存
  • GPU → 直接读写 → NVMe SSD

这能显著降低延迟、减少 CPU 开销、提升带宽利用率


VIPPCI-E 基础知识 一、PCI-E/PCI拓扑结构 PCI-E点对点结构 PCI总线结构 二、PCI-E总线特性 协议支持258个bus、每条bus最多支持32个device,每个device最多支持8个function 由BDF构成了每个PCI-E设备几点的身份证,用于PCI-E地址空间寻址。 三、PCI-E一般拓扑图 CPU --> RC --> SWITCH --> ENDPOINT --... 开通可读全文·1w 阅读·5 点赞·54 收藏 阅读全文

相关推荐

PCI Express解析——系列文章【5】:PCIe原理分析之——PCI Express 配置解析(BDF、BAR)、 MEM Read举例

上文明确PCIe的基本工作原理,下面就PCIe相关的常见配置和一些关键概念明细。PCIe总线作为处理器系统的局部总线,主要目的时为了连接处理器系统中的多个设备,当然不可避免的可连接其他处理器系统,此时PCIe体系结构的实现方案略有不同。例如Intel、PowerPC等。但是绝大多是使用了RC、Switch、PCIe-to-PCI桥、PCIe设备。其中PCIe设备也称Endpoint(EP设备)。.........

weixin_42491720的博客 5165

通用互联(如 PCIe)” vs “专用高速直连(如 NVLink)

PCIe与NVLink等专用互联技术的核心差异在于数据传输路径和延迟表现。PCIe必须经过CPU中转,导致延迟高达5-20微秒,而NVLink通过点对点直连实现1-2微秒超低延迟。此外,PCIe存在三大关键缺陷:CPU资源占用高、无法直接共享显存、多卡扩展性差。以8卡训练Llama-2-70B为例,NVLink系统吞吐量可达PCIe的3倍以上。专用互联技术在大模型训练中具有决定性优势,而PCIe仅适合轻量级应用场景。

MHD0815的博客 221

关闭Pcie ACS 重定向服务

PCIe总线中,P2PPeer-to-Peer)直通是指在PCIe拓扑中两个EndPoint设备之间直接进行数据传输,而不经过RC侧Memory,P2P直通可以提高数据传输的效率和软件设计的灵活性,P2P通信方式如下图所示。1.1 pcie p2p配置,地址匹配举例EP1 InBound 配置:target_addr: 0x900000000 (ep的ddr地址);

珂珂可爱多 4792

第54节:Peer-to-PeerP2P)访问

Peer-to-Peer 访问是指多个 GPU 设备之间直接访问彼此内存的能力,绕过主机 CPU 和 PCIe 总线,从而实现更高速、更低延迟的 GPU 间数据传输。

yumeiguo的博客 533

PCIeP2P DMA

PCIe P2P (peer-to-peer communication)PCIe的一种特性,它使两个PCIe设备之间可以直接传输数据,而不需要使用主机RAM作为临时存储。如下图3的走向比如EP1要发送和数据给EP2,操作流程如下:1. 打开EP1的dma控制器;--client侧2.src=EP1的内存地址,dst=EP2的BAR地址空间(provider),EP2的BAR地址一般会与自己的某段内存空间有一个映射关系,也就是将EP2的bar暴漏给了EP1去操作。

珂珂可爱多 2931

PCIe小知识】如何区分PCIe协议中的P2P和E2E?

上述三种传输方式,如下图所示:图中,蓝色通道表示点对点(Point to Point)传输;红色通道表示**端对端(End to End)传输;绿色通道表示同级间(Peer to Peer)**传输。

itnan110的博客 6225

PCIe P2P DMA全景解读

例如,由于主机CPU访问CMB的效率低于DDR内存,且CMB的大小有限,因此对于需要频繁、大量数据交换的应用场景,CMB可能无法提供最佳的性能。Host与存储设备数据移动优化的技术中,控制器内存缓冲区(Controller Memory Buffer,CMB)是一个重要的概念。当CPU需要访问存储设备的数据时,它可以通过内存读写事务层封装(MRd或MRw)直接访问CMB,而不需要将整个数据块传输到主机内存。随着时间的推移,随着硬件技术的进步以及软件栈的支持,如。P2P DMA技术挑战。

存储随笔 6694

NVLink与PCIe深度解析:GPU高速互联技术如何突破AI训练瓶颈

在现代高性能计算与人工智能领域,GPU间的数据交换速度往往是决定系统整体效率的关键瓶颈。通用总线标准PCIe作为连接CPU与各类扩展设备的基础设施,其树形拓扑与数据包协议虽保证了广泛的兼容性,但也带来了路径绕行与协议开销等限制。为了满足AI大模型训练、科学计算等场景下对极致带宽与超低延迟的严苛需求,专为GPU协同设计的点对点高速互联技术应运而生。这类技术通过物理直连、轻量级协议与硬件级内存访问原语,实现了GPU间显存的直接读写,从而将通信性能提升数个量级。其核心价值在于彻底释放多GPU并行计算的潜力,使得模

weixin_30321709的博客 599

芯片验证(CV,Chip Validation)芯片测试(SLT/BLT)

芯片领域:芯片验证 (CV,Chips Validation)

Edward2022的博客 2957

PCIe Switch@ACP#IX90XX/IX80XX 产品全系列介绍

芯动科技作为中国高端芯片领军企业,拥有19年技术积累,实现3nm-55nm工艺全覆盖。其PCIeSwitch产品覆盖Gen2至Gen5全世代,形成8-120Lane完整产品矩阵,支持P2P通信和温度监测。主力产品IX8024采用无阻塞Crossbar架构,24-Lane13-Port设计,功耗仅8.8W,支持热插拔和多种端口配置。产品广泛应用于数据中心、网安设备、存储扩展等领域,可替代ASMedia等国际品牌,并提供国产自主方案。芯动科技提供全生命周期技术支持,助力企业数字化转型。

ACP广源盛的博客 1148

NVIDIA GPUDirect技术解析:优化GPU通信性能

GPU通信技术在现代AI基础设施中扮演着关键角色,特别是在大模型训练和推理场景中。传统GPU通信架构需要通过CPU和系统内存中转数据,导致显著的性能瓶颈。NVIDIA GPUDirect技术通过消除不必要的数据拷贝、提升通信带宽并降低延迟,有效解决了这一问题。该技术包含节点内通信(如GPUDirect Shared Memory和Peer-to-Peer)和节点间通信(如GPUDirect RDMA)两大场景。其中,NVLink和NVSwitch技术进一步提升了GPU间的直接内存访问效率,而GPUDirec

weixin_34279184的博客 421

从 Hopper 到 Blackwell:NVIDIA GB200/B200/H200/H100 的 NVLink、nv_peer_mem 与集群通信技术深度对比

在 AI 大模型的竞赛中,算力的 “量”(单卡 FLOPS)已不再是核心竞争力,而算力的 “质”(设备间的协同效率)才是决定胜负的关键。NVIDIA 的 GB200、B200、H200、H100 在 NVLink、nv_peer_mem 和集群通信上的差异,本质是对 “如何让 GPU 更高效协同” 这一问题的不同答案。对于企业和研究者而言,理解这些 “隐形技术” 的差异,不仅能帮助选择合适的硬件,更能把握 AI 算力演进的底层逻辑 —— 未来的 AI 算力,必然是 “计算与通信深度融合” 的产物。

jundao1997的专栏 663

PCIe-2.2.10 TLP Prefix Rules-End-End(二)

使用场合:旧式中断仿真说明:为了兼容不支持 MSI(Message Signaled Interrupts)的旧设备和软件,PCIe 使用 Message TLP 来模拟传统的 INTx(INT A/B/C/D)中断线信号。当设备需要发出中断时,发送相应的 INTx Assert Message;中断处理完成后,发送 INTx Deassert Message。使用场合:设备电源状态管理说明:用于 PCIe 电源管理事件,包括:请求进入特定电源状态(如 D1、D2、D3)通知电源状态转换完成唤醒事件(PME

weixin_44700185的博客 76

NVIDIA NVLink与NVSwitch全互联技术深度解析

GPU集群通信技术是AI计算的核心基础设施,其性能直接影响大规模模型训练效率。传统PCIe总线在8卡以上配置时会出现通信瓶颈,而NVIDIA的NVLink和NVSwitch技术通过硬件级RDMA支持和非阻塞全连接拓扑,实现了900GB/s的超高带宽。这种全互联架构在ResNet-152等模型训练中可带来3倍以上的性能提升,特别适合需要高频GPU间通信的深度学习场景。通过NCCL库和CUDA P2P通信等软件优化,可以充分发挥NVLink的硬件潜力,在BERT-large等复杂模型训练中实现92%的带宽利用率

weixin_33912453的博客 332

AI大模型训练网络优化:从集合通信到拓扑感知调度(深度解析:硬件实现与底层调优)

本文面向DPU/RDMA/NVMe SSD方向的芯片设计与验证工程师,从硬件实现层面深入剖析AI大模型训练网络的全栈优化路径。覆盖RoCEv2报文处理流水线中BTH/RETH/ATH各字段的硬件分发逻辑、DCQCN拥塞控制中Token Bucket Rate Limiter的RTL级实现、NCCL GIN架构中GPU kernel构造WQE并直接敲击NIC Doorbell寄存器的完整通路、Rail-Optimized拓扑下PCIe Switch粒度对AllReduce分片策略的影响,以及P2P DMA路

专注分享DPU、RDMA智能网卡/SSD(固态硬盘)产品测试与优化 547

GPU集群性能瓶颈真相:PCIe拓扑、NVLink与Clos网络硬核解析

GPU分布式训练性能不达预期,本质常源于硬件拓扑设计缺陷——PCIe通道共享、Root Complex层级混乱导致通信绕行;NVLink虽提供高带宽点对点互联,但受限于同域约束与Bridge信号完整性;Clos网络则通过多级无阻塞交换解决大规模集群收敛比问题。这些物理层契约直接决定NCCL通信效率、all-reduce延迟与训练吞吐稳定性。本文聚焦真实服务器环境下的拓扑验证方法、NVLink实测带宽压测、NVSwitch健康监控及Rail-Optimized供电影响,覆盖采购选型、开箱快检、驱动配置到持续运

weixin_34163553的博客 179

NVIDIA GPUDirect技术解析:从原理到AI训练实战

GPU间通信技术是现代AI基础设施的核心组件,其性能直接影响大规模模型训练效率。从底层原理来看,通过PCIe总线、NVLink等物理通道实现设备直连,结合RDMA协议实现内核旁路和零拷贝传输,可大幅提升通信带宽并降低延迟。在工程实践中,GPUDirect技术通过NVSwitch全互联架构和InfiniBand网络优化,使千亿参数模型的AllReduce操作耗时从小时级压缩到分钟级。特别是在Llama3、GPT-4等大模型训练场景中,这些技术显著提升了GPU集群的通信效率。合理配置NCCL参数、优化Kuber

297

PCIe-2.2.6 ~2.2.6.2Transaction Descriptor /Transaction ID Field(Request ID & Tag)

性能优化:通过合理设置No Snoop和Relaxed Ordering,可以显著减少不必要的snoop操作和排序约束,提升系统性能。一致性管理:在支持硬件一致性的多核SoC中,Attributes字段用于协调PCIe设备与CPU缓存之间的数据一致性。内存类型区分:根据不同的内存类型(可缓存、不可缓存、写合并等)设置不同的Attributes,优化访问模式。原子操作支持:原子操作需要强制严格排序,忽略Relaxed Ordering属性。可配置性。

weixin_44700185的博客 168

CANN Runtime运行时框架概念拆解:昇腾NPU上的操作系统如何管理计算资源——Device与Stream与Event三层抽象类比理解与内存池化机制层层剖析及同步原语详解

环境隔离的重要性在本书中已经提到很多次了。通过在应用程序级(虚拟环境)和系统级(系统虚拟化)上隔离执行环境,你可以确保测试可以在可重复的条件下运行。这样,你可以避免受因破坏依赖关系导致的罕见且模糊的问题。正确隔离测试环境的最佳方法是使用支持系统虚拟化的持续集成系统。对于开源项目有很好的免费解决方案,如 Travis CI(Linux 和 OS X)或 AppVeyor(Windows),但是如果你需要这样的东西来测试私有的软件,很可能你需要花一些时间,在一些现有的开源 CI。

qq_17776737的博客 270
上一篇: 手把手教你学Simulink--机器人基础关节控制场景实例:基于Simulink的永磁同步电机关节转速PID单闭环控制仿真
下一篇: Ai芯片的FP32 和 FP16 是两种浮点数(Floating-Point)数据格式
小蘑菇二号
博客等级 码龄9年 4万+粉丝 8088原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

小蘑菇二号

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值