Google Cloud推出GPU协作式时间切片,AI算力利用率提高至70%
Google Cloud发布GPU时间切片方案
Google Cloud于2026年7月23日宣布,在llm-d项目中推出面向大模型强化学习任务的协作式时间切片技术。
这项技术将强化学习过程中的采样、训练等不同阶段视为可以单独调度的工作单元,使多个独立任务能够交替使用同一组物理GPU。
Google Cloud公布的初步测试结果显示,该机制可以将加速器整体工作率从约40%的基准水平提高至70%,同时不会影响模型收敛和准确率。 务为何会浪费GPU资源
大语言模型完成基础训练后,通常还需要通过强化学习提升推理、编程或工具调用能力。
传统同步强化学习任务会在数据采样和梯度训练之间不断切换。当采样器生成数据时,训练GPU可能处于等待状态;当训练器更新模型权重时,采样资源又可能暂时闲置。
Google Cloud表示,这类结构性等待可能导致GPU集群在整个任务生命周期中有40%至60%的时间处于空闲状态。即使采用异步架构,也无法完全消除等待最新采样数据所产生的空闲窗口。 何在多个任务间切换
当任务A进入等待阶段时,系统会暂停相关进程,并将GPU中的设备状态保存到主机内存。随后,系统恢复任务B此前保存的状态,让任务B继续使用GPU执行采样或训练。
当任务A再次获得运行权限时,其状态会重新载入GPU,使程序从暂停的位置继续执行,不需要重新启动容器、重新初始化框架或重新加载完整模型。
为了避免多个任务同时占用显存,同一时间只有一个任务状态实际驻留在GPU中。调度层通过锁队列决定不同任务的运行顺序。
GPU云服务器计费模式可能发生变化
高端GPU服务器价格较高,提高利用率可以降低单次训练任务的综合成本。对于拥有大量训练任务的AI企业而言,时间切片能够减少已经购买或租用的GPU在等待阶段产生的资源浪费。
不过,这项技术并不意味着所有GPU工作负载都适合共享。任务状态大小、主机内存容量、切换速度和数据传输开销都会影响实际效果。
对于持续满负载运行的推理服务或传统计算任务,时间切片带来的提升可能不如强化学习任务明显。
GPU云服务器市场正在从单纯比较显卡型号和数量,转向比较调度效率、网络互联、显存管理和软件栈能力。相同数量的GPU,如果资源调度方式不同,最终能够完成的有效计算量也会存在明显差异。
企业租用GPU服务器时,除关注GPU型号和显存外,还应了解是否独享物理设备、是否允许多任务调度、节点之间使用何种网络,以及存储和主机内存能否满足检查点快速保存需求。
声明:本文由SellBGP编辑部依据主办方及公开渠道信息独立撰写。转载请注明出处。