有这样一些情况,80GB显存的GPU没办法装下1750亿参数的GPT - 3模型,在经过多轮对话之后,AI因为缓存溢出而出现卡顿,这些都属于“内存焦虑”,而这些“内存焦虑”,都能够依靠内存卸载也就是Memory Offloading来破解,它是通过把GPU显存中暂时不需要用到的数据“转移”到CPU内存、SSD等次级存储当中,以此来为大模型留出核心算力空间,进而成为突破“内存墙”的关键技术。
“智能数据分级存储”乃是内存卸载的核心所在,这就如同办公室的文件管理一般:把常用文件放置在桌面也就是 GPU 显存那里,而暂时不需要使用的则归档到抽屉也就是 CPU 内存之中或者文件柜也就是 SSD 里面。其关键之处在于能够精确判断“该卸载什么以及何时进行卸载”,具体是借助分析计算流程,优先将模型权重、历史缓存等并非即时需要的数据进行卸载,等到有需求的时候再迅速回传,三星的方案正是通过这样的方式,使得单 GPU 能够运行以往原本需要 8 卡来支撑的 Bloom - 176B 模型。
其核心价值展现在“降本增效”呈现双重突破,于成本层面,三星的SSD卸载方案把大模型推理的GPU需求减去达87.5%,进而使得硬件成本大幅下降,在效率方面,HiTrain系统借由该项技术让大模型训练吞吐量提高直至30%,与此同时支持比单卡显存大一个数量级的模型运行,在多轮对话场景里,KV Cache卸载又能够让AI响应延迟降低为66%。

高效卸载的关键之处在于“智能策略”,其一为动态判断,借助运行时分析去识别“冷数据”,以此防止频繁迁移对性能造成影响,其二是异步预取,于GPU计算时令所需数据提前传回显存,以隐藏传输延迟,其三是硬件适配,运用NVMe SSD的高速带宽,使256KB大块数据的顺序读写效率实现最大化;以此减少I/O瓶颈。
现今,内存卸载已然构建起多元方案,于训练场景之中,利用HiTrain这类系统去优化数据的流转,在推理场景里,依靠三星的SSD卸载技术来压缩硬件需求,而在对话场景方面,则借助KV Cache卸载的方式提升流畅度,紧跟存储速度不断攀升以及算法实施优化步骤,它正促使大模型从“云端专属”的范畴迈向边缘设备领域之内。以此真正达成具备高效属性而且普惠性能的智能服务。