NVIDIA GB300 NVL72
液冷机架级平台,配备 72 个 Blackwell Ultra GPU 及 36 个 Grace CPU,通过机架内 NVLink 连接。适合评估其在基础设施规模的大模型训练、推理思考及推理服务中的应用。
NVLink 连接机架域内的 GPU,机架间通信采用单独设计的横向扩展网络。
根据 CUDA 软件栈验证框架、内核及集合通信,同时评估机架级供电和液冷。
两大生态 / 一位专业合作伙伴
NVIDIA 和 AMD 均可支持多种 AI 工作负载。模型规模、内存、软件兼容性及扩展需求决定平台选择。Ruk-Com 协助评估需求并验证概念验证结果,然后确定最终配置。
液冷机架级平台,配备 72 个 Blackwell Ultra GPU 及 36 个 Grace CPU,通过机架内 NVLink 连接。适合评估其在基础设施规模的大模型训练、推理思考及推理服务中的应用。
NVLink 连接机架域内的 GPU,机架间通信采用单独设计的横向扩展网络。
根据 CUDA 软件栈验证框架、内核及集合通信,同时评估机架级供电和液冷。
MI350P 是 PCIe GPU 加速器,Threadripper PRO 是主机 CPU。AMD 的 Threadripper Halo Station 展示了这一组合在本地 AI 开发、微调及推理中的应用。
Halo Station 是 AMD 原型,此处仅作为系统参考,并不表示已提供租赁或零售。
选择平台前,验证模型、框架及 GPU 支持矩阵,包括自定义内核和 CUDA 迁移需求。
我们比较您的工作负载的概念验证结果,包括吞吐量、延迟、内存和总成本,然后使网络、机房设施及支持与所选平台匹配。硬件供货情况和开通周期按项目确认。
三种方式 / 一位工程合作伙伴
从所需资源起步,或为整个团队设计基础设施。我们在部署前协助明确租赁方式及运维责任。
使用方案中分配的资源进行训练、微调或推理,适合希望使用 GPU 并由 Ruk-Com 负责基础设施准备的团队。
使用前确认资源规格及隔离方式
适合需要独立服务器并自主控制软件栈的组织,使系统配置匹配您的模型及长期运营需求。
明确系统访问权限及软件管理归属
将 GPU 工作节点、计算网络及共享存储作为整体系统设计,用于分布式训练及企业 AI 平台。
统筹规划容量、网络及扩容
价格、每台服务器的 GPU 数量、内存、存储、网络及租赁条款均在各方案中明确。
集群架构 / 跟随数据流
探索三种工作流程:数据集加载与 GPU 集合通信、推理请求与响应,以及检查点保存。计算、存储和管理保持独立。
同平台集群的逻辑流程。工作节点表示计算组,并非机架或服务器规格。网络及协议取决于硬件和验证结果。
GB300 NVL72 在机架域内使用 NVLink;MI350P 根据主机拓扑通过 PCIe 连接。必须针对所选平台设计并验证通信。
跨服务器或机架扩展时,应根据平台及集合通信库的兼容性,评估 Ethernet/RDMA 或 InfiniBand 等横向扩展网络。不同厂商的 GPU 不会合并为同一集合通信组。
设计中将存储流量与管理访问分离,以管理容量、访问策略及故障排查。
设计 / 安装 / 验证
Ruk-Com 贯通各个层级:机架、操作系统与驱动、网络、运行时及工作负载验证,并提供配置记录及运维手册。
安装操作系统及厂商驱动。验证固件、NVIDIA 的 CUDA 或 AMD 的 ROCm/HIP,以及容器运行时,并记录兼容性矩阵。
设计 IP 地址、VLAN、路由及网络连接,验证 GPU 工作节点与存储之间的路径。
使用 Kubernetes 或 Slurm,针对工作负载设计调度,包括用户访问、配额及作业提交。
规划数据集、模型及检查点存储。将保留、备份和恢复流程与训练循环分开定义。
验证 GPU 健康状况、压力老化测试及集合通信,在受支持的情况下对 NVIDIA 使用 NCCL、对 AMD 使用 RCCL。按照约定的 PoC 标准,对数据流程及实际模型进行基准测试。
明确管理访问、机密信息处理及变更窗口,并配置监控、告警及工程师升级处理流程。
软件、许可证、集成及支持级别根据各工作负载和方案选择,并非每个方案均自动包含。
RUK-COM 数据中心 / 托管
除租赁资源外,您还可将 GPU 服务器托管在 Ruk-Com 数据中心。团队将供电、制冷、机架及网络作为统一部署计划的一部分进行评估。
根据实际配置评估尺寸、重量及供电。
针对服务器型号验证制冷需求及机房设施接口。
规划集群、存储及企业系统的连接。
在约定服务范围内完成安装、布线、标记及现场工作协调。
与 Ruk-Com 工程师建立可观测性及运维手册。在明确权限和审批控制的范围内,评估 Ruk-Com Agent 用于信号分析及运维优先级排序。
工作负载匹配 / 业务成果
从模型规模、数据集及工作负载目标出发,确定合适的 GPU、网络和存储配置。
适合开发模型或使模型适配企业数据的团队,评估内存、批次大小及迭代时间。
为 API、助手及企业私有 AI 构建服务栈,评估延迟、并发及数据访问。
围绕队列、项目及资源策略构建多团队集群,并使用利用率数据进行容量规划。
交付 / 每一步都有依据
为 GPU 投资明确范围、责任归属及验收标准,并提供团队可用于系统运维的验证依据。
审查工作负载、模型、数据集及访问需求。
确认硬件、网络、存储及服务边界。
按照验收标准进行安装、集成及测试。
移交文档、访问权限及运维联系人。
部署之前
从您的需求出发,围绕实际工作负载明确服务边界。
GPU 算力侧重于分配给工作负载的资源。独立服务器提供整机级边界;专属集群则涵盖多台服务器、网络及支持系统。隔离方式、权限及资源规格将在方案中确认。
从工作负载、模型内存及软件栈出发,再通过 PoC 验证合适配置。GB300 NVL72 是机架级平台;MI350P 是 PCIe GPU 加速器,Halo Station 仍为原型。可供型号、容量及交付周期将在下单前确认。
我们评估并配置平台专属软件栈:NVIDIA 使用 CUDA/NCCL,AMD 使用 ROCm/HIP/RCCL。检查 GPU、操作系统、框架、容器运行时及调度器的支持情况,并明确版本、许可证及管理归属。不会假定 CUDA 工作负载可在未经验证的情况下迁移至 AMD。
不一定。集合通信模式、适配器、交换机、软件兼容性及预算都会影响选择。团队将根据实际配置设计并验证合适的网络。
这取决于框架、调度器及检查点策略。必须明确设计状态持久化及重启或恢复流程;这并不表示 GPU 工作负载能够自动、不间断地迁移。
可以。团队将评估服务器型号、供电、制冷、机架需求及网络,然后明确安装、远程现场协助及协调责任。