
新思路:U盘技术缓解大模型内存焦虑
IEEE最新刊发新思路,大模型的内存焦虑或能用U盘同款技术NAND Flash缓解。不少人印象里,Flash虽便宜、容量大、断电不丢数据,但速度慢,用它驱动大模型推理看似并非正经方案。
推动HBF技术突围
如今,SanDisk和SK海力士正推动High Bandwidth Flash(高带宽闪存,简称HBF)。其思路是将HBM(高带宽内存)的先进封装和芯片堆叠方法用于NAND Flash,让闪存参与AI推理的高速数据供给。据SanDisk公开资料,HBF预计最多可堆叠16颗NAND Flash芯片,目标单个堆栈容量最高达512GB,目标读取带宽最高达1.6TB/s,后续第二代、第三代读取带宽还会提升到2TB/s和3.2TB/s,虽追不上顶级HBM,但已非传统闪存的“慢吞吞存储”状态。
技术突围背后的困局
这一技术突围背后,或是全球存储行业亟待化解的供应紧缺困局。北京时间7月11号,韩国存储巨头SK海力士的首席执行官郭鲁正曾在美股纳斯达克首秀之日公开表示,全球存储行业预计将在2027年面临史上最严重的供应短缺,该言论迅速引爆资本市场与产业舆论。在此背景下,SK海力士携手SanDisk推出HBF,或许是他们为缓解存储供应紧张交出的技术答卷。
Flash写入慢却能用在AI?
很多人疑惑,Flash写入慢,怎么突然能用于AI?半导体市场研究机构Objective Analysis总监Jim Handy在IEEE Spectrum采访中提到,很多人第一反应也觉得说不通。关键在于,Flash慢主要慢在写入。NAND Flash通过浮栅晶体管里的电荷存储数据,并按块和页组织,这种机制使其断电后能保留数据,无需像DRAM那样不断刷新,天然适合长期存储,兼具高密度与低成本优势,但写入时把电荷推进或移出绝缘栅的过程比给电容充放电慢得多,所以在传统计算视角下,Flash难和DRAM、HBM这类高速内存相提并论。
读取情况不同,HBF提高总读取带宽
不过只看读取,情况就不同了。按最新ONFI 6.0闪存接口标准,单颗die理论带宽最高可达4.8GB/s,和DDR5单条DIMM最高70.4GB/s、HBM4E单堆栈3.6TB/s相比,有大约750倍量级差距。HBF通过3D封装和垂直堆叠,把多个NAND Flash die打包,显著提高总读取带宽。SK海力士内存系统研究高级副总裁Hoshik Kim指出:“通过将先进的3D封装和垂直堆叠技术应用于NAND闪存,HBF能够实现远超标准NVMe存储的带宽。”HBF通过堆叠NAND闪存裸片,打造高存储密度芯片,并非让单颗Flash变快,而是通过堆叠和封装堆出读取通道。
HBF找准适合场景——AI推理
HBF真正有意思的地方,不在于取代HBM,而在于找准了适合Flash的场景——AI推理。训练和推理对内存要求不同,训练大模型时,系统要大量读写,Flash写入慢,还涉及寿命和擦写管理问题,对其不友好;但推理阶段,模型已完成训练,权重基本冻结,系统主要是快速读出庞大的模型权重,这正是Flash相对擅长的。SK海力士内存系统研究高级副总裁Kim表示:“在推理环境中,诸如静态的数十亿参数模型权重或预计算的KV缓存(precomputed KV cache)等海量、读密集型数据,均可稳妥地存放于HBF层级。”这样一来,昂贵且容量有限的HBM就能被释放出来,专门充当高速暂存区,这个架构像给AI加了一层“超大容量只读内存池”,HBM负责紧急、频繁的高速计算数据交换,HBF负责装下体量巨大、改动少的模型参数。
解决大模型推理困境,HBF或降低成本
当前大模型推理面临算力短缺、内存不够、带宽不够、能耗太高、部署成本太贵等多重压力,尤其是模型规模持续膨胀,单卡显存容量不足与HBM成本高昂制约其发展,很多时候不是GPU算不动,而是模型装不下或数据喂不过来。而HBF若能在容量、带宽和成本之间找到平衡,就可能让更大的模型以更低的成本跑起来。
第一代HBF参数及潜在收益
SanDisk给出的第一代HBF目标参数为最高512GB容量、1.6TB/s读取带宽。HBM速度快但容量昂贵有限,HBF速度低一些,但能提供更大容量和更低单位成本。这意味着未来AI服务器部署大模型推理时,不一定要把所有权重都塞进HBM,一部分冷一点、静态一点、读多写少的数据可放在HBF里。这样做有几个潜在收益:一是缓解HBM容量瓶颈;二是减少为装下模型而堆更多加速卡的需求;三是降低推理系统整体成本和能耗。Kim判断HBF与HBM不是竞争对手,而是互为补充的工具,HBF能在不牺牲数据供给速度的前提下,缓解HBM容量瓶颈,有望减少运行大规模模型所需的加速器数量,还将提升能效、降低成本,助力数据中心扩展AI推理硬件规模。这也是HBF最值得关注的产业逻辑:让AI系统里的不同数据待在更适合自己的位置,热数据放HBM,大容量、静态、读密集数据放HBF,更低速、更便宜的数据放SSD或其他存储,若这套分层成立,AI推理硬件的内存架构可能会多出一个新层级。
HBF尚不成熟,但发出分工新信号
当然,HBF目前还不是成熟产品。据IEEE Spectrum报道,HBF至少还需一年才可能出货,距离大规模部署可能还要几年。今年2月25日,SanDisk和SK海力士联合举办启动活动,宣布在开放计算项目OCP下推动HBF标准化工作。OCP作为数据中心硬件领域重要的开放产业组织,主导制定了大量服务器、机柜、电源及加速器相关规范。但目前,HBF标准还在推进中,正式发布时间尚未确定,这意味着HBF短期内不会马上改变AI服务器市场,它更像是提前浮出水面的信号:AI推理正在逼着存储和内存体系重新分工。过去,大模型硬件关注点集中在GPU、HBM和互联,当模型变大、推理请求增多,瓶颈就会从“算得快不快”扩展到“装不装得下”“读不读得动”以及“电费扛不扛得住”,HBF切入的正是这个缝隙。
SK海力士的商业考量
有意思的是,SK海力士本身是HBM最大赢家之一,HBM为其带来创纪录收入,推出更便宜的替代性技术HBF似乎不符合商业直觉。但从系统角度看,HBF不一定会抢HBM的饭碗,AI服务器未来需要分层内存,让HBM负责极致性能,HBF负责大容量高带宽读取,SSD负责更低成本的大规模存储,这套组合跑通会让AI推理系统更可扩展。简单说,不是每一份模型数据都值得用HBM,有些数据只需要容量够大、读取够快、成本更低的位置,HBF想做的就是这个位置。从U盘、SD卡里的NAND Flash到AI服务器里的高带宽模型权重池,跨度虽大,但大模型问题明显:参数增多、推理变贵、HBM紧张,而解决方案未必只来自更贵的内存,也可能来自把熟悉的老技术重新封装。


被折叠的 条评论
为什么被折叠?



