博客

通过ZStack AIOS提升AI性能——高级GPU调度、MIG切片和多租户,以实现更快的训练和更高的云效率。

返回列表

计算资源编排和GPU虚拟化:构建下一代AI基础设施

从 VMware 迁移到现代 GPU 驱动的基础设施
理解从传统虚拟化转变的趋势
企业虚拟化世界正在迅速变化。随着许可证的最近变化和不断增长的订阅费用,许多组织正在重新考虑他们对 VMware 的持续使用。这种变化不仅仅是寻找成本更低的许可证。它显示出更大的趋势,即向开放、可扩展和适合 AI 的虚拟化平台转变。
旧的虚拟机设置是为以 CPU 为中心的工作而设计的。随着人工智能(AI)、机器学习(ML)和深度学习工作的发展,计算需求超出了标准虚拟化能够很好地处理的范围。公司现在转向管理 CPU 和 GPU 工具的平台。他们这样做是为了处理基于大量数据的工作。
迁移期间的关键考虑因素
在计划 VMware 迁移时,大多数 IT 团队面临相同的问题。他们需要保持工作适应性,确保数据保持完整,并减少停机时间。顺利的迁移需要一个编排框架。这个框架可以智能地处理混合设置中的工具。
当前支持 GPU 的虚拟化平台不仅仅是标准的迁移。它们允许实时 GPU 计划、多用户共享和适应增长。这些技能让公司轻松地从与 CPU 绑定的虚拟化转向基于 AI 的构建,而无需供应商绑定。
在 AI 时代,为什么计算资源编排很重要
定义计算资源编排
计算资源编排意味着智能处理不同硬件类型上的计算、网络和存储工具。它让系统根据需要自动为每个作业提供正确的处理器类型——CPU、GPU,甚至是 FPGA。
这种编排确保使用保持均匀和灵活。系统不是手动分配工具,而是基于当前的性能数字和 AI 作业需求来分配它们。它将固定构建转变为工作、实时设置。
编排在 AI/ML 管道中的作用
在 AI 和 ML 管道中,编排直接影响速度和成本。更好的计划框架可以将 GPU 利用率提高一倍,与固定设置相比。
通过编排,GPU 组可以自动在训练、猜测和预工作作业之间平衡。对于多用户或多组设置,编排还确保公平性。每个用户或作业都能获得稳定的速率和确定的计算能力访问。
没有它,GPU 工具常常闲置或阻塞。这导致资金浪费。有了编排,每个 GPU 步骤都得到了充分利用。它加快了 AI 项目的时间,并降低了构建费用。
GPU 虚拟化:从共享到隔离
GPU 虚拟化的核心概念
GPU 虚拟化允许一个或多个虚拟机或容器很好地共享物理 GPU 资源。这对 AI 作业很重要,因为需求变化迅速,分割是关键。
通过将 GPU 隐藏在虚拟设备中,许多作业可以同时在相同的硬件上运行。这提高了充分利用。它还使 GPU 对较小的 AI 任务开放。这允许更好的工具使用,而不会过度设置。
GPU 虚拟化方法
目前在数据中心广泛使用的三种主要 GPU 虚拟化方式:
GPU 共享(vGPU):允许许多 VM 或容器同时访问一个 GPU。它适合猜测或查看作业。
GPU 直通:为高速训练或绘图作业向一个 VM 提供对 GPU 的完全访问。
MIG(多实例 GPU):NVIDIA 的硬件级技术,将一个 GPU 分成多个分割实例。每个实例都有固定的内存和计算部分。
MIG 非常适合多用户 AI 设置。在那里,分割和速度稳定性同样重要。基于 MIG 的分割可以将使用率提高 70-80%。它保持了工作的自由。
GPU 虚拟化的好处
GPU 虚拟化节省成本并提高便利性。它允许 IT 团队根据作业需求设置虚拟 GPU(vGPU)。他们可以为繁重的训练作业提供完整的 GPU。他们可以将其他人分割用于轻量级任务。
此外,它使维护更简单。当 GPU 被虚拟化时,硬件或驱动程序更改可以在很少的服务中断下发生。这对基于 AI 的公司来说是一个巨大的优势。
在云原生环境中编排 GPU 工作负载
Kubernetes 和 AI 集群中的 GPU 调度
当今的 AI 构建更多地基于容器化的云原生系统,如 Kubernetes。但 Kubernetes 中的 GPU 调度比 CPU 调度要困难得多。GPU 有不同的构建和驱动程序需求。
像 Kubernetes 设备插件和 vCluster GPU 共享框架这样的工具使得现在可以提供 GPU 分片。GPU 编排不仅涉及提供计算单元。它还处理数据就近、内存共享和容器分割。这些在 AI 训练中是良好使用的关键部分。
GPU 管理中的多租户
在大型 AI 组中,许多团队同时需要 GPU 工具。没有正确的编排,一个作业可能会接管工具。
通过现在根据用户限制和作业类型提供 GPU 分片来解决这个问题。例如,高需求的训练作业可能会获得完整的 GPU。猜测作业使用 MIG 实例或共享 vGPU。
这种模型提高了易用性。多租户 GPU 编排可以将计算包提高 30-40%。它保持了作业的分割和稳定性。
因此,公司可以

联系我们