笔记转载自:“H3C ICT知识百科

什么是GDS?

GDS(GPUDirect Storage,GPU直接存储)是NVIDIA推出的数据传输技术,旨在消除传统计算架构中GPU(Graphics Processing Unit,图形处理器)与存储设备间的性能瓶颈。其核心是绕过CPU(Central Processing Unit,中央处理器)中转,使GPU能够直接读写本地或远程存储设备(如NVMe SSD、分布式存储系统),构建端到端数据直连通道,提升I/O(Input/Output,输入/输出)效率。

为什么需要GDS?

GPU算力爆发下的I/O瓶颈

现代AI与数据科学依赖数据驱动。在深度学习训练、科学模拟等高性能计算场景中,GPU需要持续高效地访问存储系统中的海量数据。随着数据集规模增长,GPU与存储设备间的高带宽、低延迟通信成为计算效率的关键。

I/O指数据在计算核心与外部设备间的传输过程。传统I/O架构由CPU主导,但随着计算重心转向GPU,存储I/O性能与GPU算力的差距日益凸显。GPU计算性能每代提升约1.5倍,而存储设备带宽增速明显滞后。高端GPU显存带宽可达3TB/s,顶级企业级NVMe SSD性能仅7GB/s(PCIe 4.0 x4接口理论极限),相差400倍以上。这种“存储墙”效应,导致GPU频繁陷入数据饥饿状态,使I/O成为制约系统性能的主要瓶颈。
图1 GPU、CPU与存储设备的带宽对比

在AI产业化落地的背景下,I/O性能优化已从技术课题转变为商业刚需。行业数据显示,AI训练任务中30%以上时间耗费在数据加载环节。要突破这一瓶颈,需硬件技术(如GDS、CXL等)与软件技术(如智能预取、存算融合等)协同创新。

GDS的核心优势

GDS技术实现存储设备与GPU显存的端到端直连传输,绕过传统I/O路径中CPU管控的数据拷贝和内存缓冲,带来以下优势:

  • 更低的延迟:减少数据传输环节,I/O延迟显著降低。
  • 更高的带宽利用率:消除传统I/O路径(存储→内存→GPU)的两次数据拷贝,PCIe带宽利用率显著提升。
  • 更少的CPU开销:CPU无需参与数据搬运,可专注于计算任务,减轻负担。

GDS有哪些典型应用场景?

大规模AI模型训练

千亿级参数模型的训练需持续加载海量分布式数据集,传统数据传输需经过存储、CPU内存、GPU显存的多级中转。由于CPU处理环节存在带宽瓶颈与额外开销,导致GPU计算单元频繁空闲等待,严重影响训练效率。
GDS通过存储到GPU显存的直通传输架构,绕过CPU内存的中转环节,使得训练数据分片能够直接加载至GPU。例如,在视觉模型训练中,分布式存储中的图像数据可通过高速网络协议直传至GPU,显著降低数据加载延迟并提升GPU利用率。

高精度科学仿真

流体力学、核物理等仿真需处理大规模时空网格数据,传统方法因CPU内存容量限制,需频繁读写存储设备,且CPU到GPU的数据搬运延迟成为性能瓶颈,难以满足实时迭代需求。
GDS支持仿真数据从存储集群直接传输至GPU显存,通过预分配显存资源和异步传输机制,实现数据传输与计算任务的重叠。例如,在瞬态仿真场景中,流场数据通过直通方式加载至GPU,结合多GPU间的直接数据交换能力,减少中间数据回写,显著提升仿真迭代速度与扩展效率。

实时医学影像重建

医学影像设备生成的高速动态数据需实时处理,传统流程因CPU中转和多次内存拷贝导致延迟过高,无法满足手术导航等实时性要求;历史影像调阅时的大规模数据加载也存在响应缓慢问题。
GDS建立医疗设备与GPU显存的直连通道,使原始数据可直接映射到GPU进行实时重建与分析。例如,在影像设备的数据管线中,原始信号通过直通传输进入GPU,结合显存分区管理技术,同时支持实时处理与历史数据的快速加载,显著缩短端到端延迟和三维渲染准备时间。

高频量化交易分析

高频交易需在极短时间内处理TB级行情数据,传统方案依赖CPU聚合数据后再传输至GPU,导致延迟波动和带宽瓶颈,难以支撑实时风险计算与策略更新。
通过直通式数据传输架构,GDS能够同时将来自不同存储层级的金融数据(包括内存中的实时交易数据和存储设备中的历史市场数据)直接并行加载至GPU显存,使得多源异构金融数据能够在GPU计算单元中实现高效融合处理,显著提升了高频交易分析、实时风险建模等复杂金融场景的数据处理效率,同时保证了计算过程的低延迟稳定性。

自动驾驶数据湖处理

自动驾驶产生的多模态传感器数据需高效预处理,传统流程因CPU处理速度不足导致数据准备耗时过长,且多传感器数据同步精度不足影响模型训练效果。
GDS构建从存储到GPU的直通处理流水线,例如将点云、视频流等原始数据直接加载至GPU显存,利用并行计算能力完成解码、滤波等操作。同时通过硬件级时间戳机制实现多传感器数据的纳秒级同步,显著提升处理速度与多模态融合精度,减少训练管线中的资源浪费。

GDS如何工作?

GDS的核心目标是绕过CPU与主机内存的中转环节,在存储设备与GPU显存间建立端到端直连通道,消除传统I/O路径中的冗余数据拷贝与CPU性能瓶颈。其实现依赖DMA、PCIe P2P及内存一致性模型等底层技术协同支持。在实践中,GDS通常会与GPUDirect技术栈中的其他技术协同,构建完整的端到端加速框架。
详细介绍请参见:“H3C ICT知识百科

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐