RUK-COM / NVIDIA + AMD 基础设施

面向 AI 规模的算力。
基础设施专业知识。
围绕您的需求构建。

从 GPU 算力到独立服务器和专属集群,Ruk-Com 根据您的模型、软件及预算协助选择 NVIDIA 或 AMD。我们统筹设计计算、网络和存储,并提供安装、验证及约定范围内的运维支持。

NVIDIA + AMD 集群工程 Ruk-Com 专家团队

两大生态 / 一位专业合作伙伴

为工作负载匹配合适平台。
覆盖整个系统的专业能力。

NVIDIA 和 AMD 均可支持多种 AI 工作负载。模型规模、内存、软件兼容性及扩展需求决定平台选择。Ruk-Com 协助评估需求并验证概念验证结果,然后确定最终配置。

NVIDIA机架级 AI

NVIDIA GB300 NVL72

液冷机架级平台,配备 72 个 Blackwell Ultra GPU 及 36 个 Grace CPU,通过机架内 NVLink 连接。适合评估其在基础设施规模的大模型训练、推理思考及推理服务中的应用。

NVLink / 横向扩展

NVLink 连接机架域内的 GPU,机架间通信采用单独设计的横向扩展网络。

CUDA / NCCL

根据 CUDA 软件栈验证框架、内核及集合通信,同时评估机架级供电和液冷。

NVIDIA 平台参考 →
AMD本地 AI / 工作站

AMD Instinct MI350P

MI350P 是 PCIe GPU 加速器,Threadripper PRO 是主机 CPU。AMD 的 Threadripper Halo Station 展示了这一组合在本地 AI 开发、微调及推理中的应用。

工作站参考

Halo Station 是 AMD 原型,此处仅作为系统参考,并不表示已提供租赁或零售。

ROCm / HIP / RCCL

选择平台前,验证模型、框架及 GPU 支持矩阵,包括自定义内核和 CUDA 迁移需求。

AMD Halo Station 参考 →
Ruk-Com 平台咨询

我们比较您的工作负载的概念验证结果,包括吞吐量、延迟、内存和总成本,然后使网络、机房设施及支持与所选平台匹配。硬件供货情况和开通周期按项目确认。

三种方式 / 一位工程合作伙伴

您的工作负载。
您的部署方式。

从所需资源起步,或为整个团队设计基础设施。我们在部署前协助明确租赁方式及运维责任。

01 / GPU 算力

GPU 算力

适合工作负载的 GPU 资源

使用方案中分配的资源进行训练、微调或推理,适合希望使用 GPU 并由 Ruk-Com 负责基础设施准备的团队。

  • 规划 GPU、CPU、RAM 和存储规格
  • 明确环境及访问边界
  • 为模型匹配运行时
资源分配

使用前确认资源规格及隔离方式

讨论此方案
02 / 独立服务器

独立服务器

由专家配置的独立服务器

适合需要独立服务器并自主控制软件栈的组织,使系统配置匹配您的模型及长期运营需求。

  • 按照约定配置提供独立服务器
  • 安装操作系统、驱动及 GPU 运行时
  • 配置网络、存储及监控
服务器边界

明确系统访问权限及软件管理归属

讨论此方案
03 / 专属集群

专属集群

多台服务器,统一设计的集群。

将 GPU 工作节点、计算网络及共享存储作为整体系统设计,用于分布式训练及企业 AI 平台。

  • 拓扑及节点间网络设计
  • 调度器与 GPU 工作节点集成
  • 集合通信及端到端工作负载验证
集群边界

统筹规划容量、网络及扩容

讨论此方案

价格、每台服务器的 GPU 数量、内存、存储、网络及租赁条款均在各方案中明确。

集群架构 / 跟随数据流

强大的 GPU 需要
同样出色的系统。

探索三种工作流程:数据集加载与 GPU 集合通信、推理请求与响应,以及检查点保存。计算、存储和管理保持独立。

客户端 / AI 团队
SDK · API · 作业提交
服务端点
推理请求 / 响应
GPU 工作节点 01
同平台 GPU 组
GPU↔GPU
平台互连
计算网络
GPU 组之间
GPU 工作节点 02
同平台 GPU 组
GPU↔GPU
平台互连
共享存储
数据集 · 模型 · 检查点
数据集 / 检查点GPU 集合通信推理请求推理响应

同平台集群的逻辑流程。工作节点表示计算组,并非机架或服务器规格。网络及协议取决于硬件和验证结果。

平台内部

GB300 NVL72 在机架域内使用 NVLink;MI350P 根据主机拓扑通过 PCIe 连接。必须针对所选平台设计并验证通信。

GPU 工作节点之间

跨服务器或机架扩展时,应根据平台及集合通信库的兼容性,评估 Ethernet/RDMA 或 InfiniBand 等横向扩展网络。不同厂商的 GPU 不会合并为同一集合通信组。

数据与控制分离

设计中将存储流量与管理访问分离,以管理容量、访问策略及故障排查。

设计 / 安装 / 验证

从硬件到平台
让您的团队投入实际使用。

Ruk-Com 贯通各个层级:机架、操作系统与驱动、网络、运行时及工作负载验证,并提供配置记录及运维手册。

操作系统与 GPU 启用

安装操作系统及厂商驱动。验证固件、NVIDIA 的 CUDA 或 AMD 的 ROCm/HIP,以及容器运行时,并记录兼容性矩阵。

网络与集群集成

设计 IP 地址、VLAN、路由及网络连接,验证 GPU 工作节点与存储之间的路径。

调度与编排

使用 Kubernetes 或 Slurm,针对工作负载设计调度,包括用户访问、配额及作业提交。

数据流程与恢复

规划数据集、模型及检查点存储。将保留、备份和恢复流程与训练循环分开定义。

工作负载验证

验证 GPU 健康状况、压力老化测试及集合通信,在受支持的情况下对 NVIDIA 使用 NCCL、对 AMD 使用 RCCL。按照约定的 PoC 标准,对数据流程及实际模型进行基准测试。

安全运维

明确管理访问、机密信息处理及变更窗口,并配置监控、告警及工程师升级处理流程。

软件、许可证、集成及支持级别根据各工作负载和方案选择,并非每个方案均自动包含。

RUK-COM 数据中心 / 托管

已经拥有硬件?
托管服务器,连接集群。

除租赁资源外,您还可将 GPU 服务器托管在 Ruk-Com 数据中心。团队将供电、制冷、机架及网络作为统一部署计划的一部分进行评估。

RUK-COM 数据中心GPU 部署 / 机房就绪情况
机架与供电

根据实际配置评估尺寸、重量及供电。

制冷设计

针对服务器型号验证制冷需求及机房设施接口。

私有连接

规划集群、存储及企业系统的连接。

安装与远程现场协助

在约定服务范围内完成安装、布线、标记及现场工作协调。

工程师主导,AI 辅助。

与 Ruk-Com 工程师建立可观测性及运维手册。在明确权限和审批控制的范围内,评估 Ruk-Com Agent 用于信号分析及运维优先级排序。

Ruk-Com Agent

工作负载匹配 / 业务成果

面向 AI 的基础设施
承载实际工作。

从模型规模、数据集及工作负载目标出发,确定合适的 GPU、网络和存储配置。

训练与微调

适合开发模型或使模型适配企业数据的团队,评估内存、批次大小及迭代时间。

推理与私有 AI

为 API、助手及企业私有 AI 构建服务栈,评估延迟、并发及数据访问。

研究与 AI 平台

围绕队列、项目及资源策略构建多团队集群,并使用利用率数据进行容量规划。

交付 / 每一步都有依据

一位工程合作伙伴。
从设计到交接。

为 GPU 投资明确范围、责任归属及验收标准,并提供团队可用于系统运维的验证依据。

01

需求分析与规格规划

审查工作负载、模型、数据集及访问需求。

交付成果工作负载概况与资源规格
02

设计与配置

确认硬件、网络、存储及服务边界。

交付成果约定的拓扑与配置
03

安装与验证

按照验收标准进行安装、集成及测试。

交付成果测试依据与性能基线
04

交接与运维

移交文档、访问权限及运维联系人。

交付成果运维手册与支持责任归属

部署之前

在部署之前
明确您的 GPU 方案。

从您的需求出发,围绕实际工作负载明确服务边界。

GPU 算力、独立服务器和专属集群有何区别?

GPU 算力侧重于分配给工作负载的资源。独立服务器提供整机级边界;专属集群则涵盖多台服务器、网络及支持系统。隔离方式、权限及资源规格将在方案中确认。

如何选择 GB300 NVL72 或 AMD MI350P?

从工作负载、模型内存及软件栈出发,再通过 PoC 验证合适配置。GB300 NVL72 是机架级平台;MI350P 是 PCIe GPU 加速器,Halo Station 仍为原型。可供型号、容量及交付周期将在下单前确认。

能否配置 CUDA、ROCm、Kubernetes 或 Slurm?

我们评估并配置平台专属软件栈:NVIDIA 使用 CUDA/NCCL,AMD 使用 ROCm/HIP/RCCL。检查 GPU、操作系统、框架、容器运行时及调度器的支持情况,并明确版本、许可证及管理归属。不会假定 CUDA 工作负载可在未经验证的情况下迁移至 AMD。

每个集群都需要 InfiniBand 吗?

不一定。集合通信模式、适配器、交换机、软件兼容性及预算都会影响选择。团队将根据实际配置设计并验证合适的网络。

服务器故障后,训练会立即继续吗?

这取决于框架、调度器及检查点策略。必须明确设计状态持久化及重启或恢复流程;这并不表示 GPU 工作负载能够自动、不间断地迁移。

可以托管我们自己的 GPU 服务器吗?

可以。团队将评估服务器型号、供电、制冷、机架需求及网络,然后明确安装、远程现场协助及协调责任。

NVIDIA + AMD / RUK-COM 工程

带上您的 AI 目标。
共同设计基础设施。

分享您的模型、数据集、用户量或训练作业规模,以及偏好的部署方式。Ruk-Com 将协助把 GPU、网络、存储及安装统筹规划为完整方案。