RUK-COM / NVIDIA + AMD INFRASTRUCTURE

พลังประมวลผลระดับ AI
พร้อมทีมที่เข้าใจ
ทั้ง Infrastructure

จาก GPU Compute สู่ Dedicated Server และ Cluster ทีม Ruk-Com ช่วยเลือก NVIDIA หรือ AMD ให้เหมาะกับ Model, Software และงบประมาณ พร้อมออกแบบ Compute, Network และ Storage ติดตั้ง ทดสอบ และดูแล Infrastructure ให้เป็นระบบเดียวกัน

NVIDIA + AMD Cluster Engineering Ruk-Com Experts

TWO ECOSYSTEMS / ONE EXPERT PARTNER

เลือก GPU จากงานจริง
พร้อมคำแนะนำที่มองทั้งระบบ

NVIDIA และ AMD รองรับงาน AI ได้หลายรูปแบบ จุดเริ่มต้นในการเลือกคือขนาด Model, Memory, Software Compatibility และการขยายระบบ ทีม Ruk-Com ช่วยประเมินและทำ PoC ก่อนสรุป Configuration

NVIDIARACK-SCALE AI

NVIDIA GB300 NVL72

Rack-scale platform แบบ Liquid-cooled รวม 72 Blackwell Ultra GPUs และ 36 Grace CPUs เชื่อมด้วย NVLink ภายใน Rack เหมาะให้ประเมินสำหรับ Large-model Training, Reasoning และ Inference ที่ต้องขยายระดับ Infrastructure

NVLink / Scale-out

NVLink เชื่อม GPU ใน Rack domain ส่วนการเชื่อมข้าม Rack ใช้ Scale-out Fabric ที่ออกแบบแยกกัน

CUDA / NCCL

ตรวจ Framework, Kernel และ Collective ให้ตรงกับ CUDA Stack พร้อมประเมิน Power และ Liquid Cooling ทั้ง Rack

ข้อมูล Platform จาก NVIDIA →
AMDLOCAL AI / WORKSTATION

AMD Instinct MI350P

MI350P คือ GPU accelerator แบบ PCIe ส่วน Threadripper PRO คือ Host CPU ตัวอย่าง Threadripper Halo Station ของ AMD แสดงการใช้ร่วมกันสำหรับ Local AI Development, Fine-tuning และ Inference

Workstation reference

Halo Station เป็น Prototype จาก AMD ใช้เป็นแนวทางประเมินระบบ ไม่ใช่การประกาศว่ามีเครื่องรุ่นนี้พร้อมเช่าหรือจำหน่าย

ROCm / HIP / RCCL

ตรวจ Model, Framework และ GPU Support Matrix รวม Custom Kernel และการย้ายจาก CUDA ก่อนเลือกใช้งาน

ข้อมูล Halo Station จาก AMD →
Ruk-Com platform advisory

เราช่วยเทียบผล PoC จาก Workload จริง ทั้ง Throughput, Latency, Memory และต้นทุนรวม พร้อมออกแบบ Network, Facility และ Support ให้เหมาะกับ Platform ที่เลือก รุ่นเครื่อง สต็อกและระยะเวลาจัดเตรียมยืนยันในข้อเสนอเป็นรายโครงการ

THREE WAYS / ONE ENGINEERING PARTNER

เลือกขอบเขตทรัพยากร
ให้ตรงกับวิธีทำงานของคุณ

เริ่มจากทรัพยากรที่ต้องใช้ หรือวาง Infrastructure เฉพาะสำหรับทั้งทีม เราช่วยประเมินรูปแบบการเช่าและความรับผิดชอบก่อนเริ่มระบบ

01 / GPU COMPUTE

GPU Compute

เช่าพลัง GPU สำหรับงานของคุณ

เริ่ม Training, Fine-tuning หรือ Inference ด้วยทรัพยากรที่จัดสรรตามข้อเสนอ เหมาะกับทีมที่ต้องการใช้ GPU โดยให้เราช่วยเตรียม Infrastructure

  • ประเมิน GPU, CPU, RAM และ Storage
  • กำหนด Environment และสิทธิ์เข้าถึง
  • เลือก Runtime ให้ตรงกับโมเดล
Resource allocation

ขนาดทรัพยากรและรูปแบบ Isolation ยืนยันก่อนใช้งาน

ปรึกษา Solution นี้
02 / DEDICATED SERVER

Dedicated Server

ควบคุมทั้งเครื่อง พร้อมทีมช่วยติดตั้ง

สำหรับองค์กรที่ต้องการ Server เฉพาะและวาง Software Stack ของตนเอง เลือกองค์ประกอบระบบให้เหมาะกับ Model และการดูแลระยะยาว

  • Server เฉพาะตาม Configuration ที่ตกลง
  • ติดตั้ง OS, Driver และ GPU Runtime
  • จัด Network, Storage และ Monitoring
Server boundary

กำหนดสิทธิ์ระดับระบบและผู้รับผิดชอบ Software ให้ชัดเจน

ปรึกษา Solution นี้
03 / DEDICATED CLUSTER

Dedicated Cluster

เชื่อมหลายเครื่อง เป็น GPU Cluster

วางแผน GPU Workers, Compute Fabric และ Shared Storage เป็นระบบเดียว สำหรับ Distributed Training และ AI Platform ระดับองค์กร

  • ออกแบบ Topology และ Inter-node Fabric
  • เชื่อม Scheduler กับ GPU Workers
  • ทดสอบ Collective และ End-to-end Workload
Cluster boundary

วางแผน Capacity, Network และการขยายระบบร่วมกัน

ปรึกษา Solution นี้

ราคา จำนวน GPU ต่อเครื่อง Memory, Storage, Network และระยะเวลาการเช่า ระบุในข้อเสนอของแต่ละ Solution

CLUSTER ARCHITECTURE / FOLLOW THE DATA

GPU ที่ทรงพลัง ต้องมีระบบ
ที่ส่งข้อมูลได้ทันกัน

ดูการทำงาน 3 รูปแบบ ตั้งแต่โหลด Dataset แลกเปลี่ยนผลระหว่าง GPU ไปจนถึงส่ง Inference Response และบันทึก Checkpoint แยก Compute, Storage และ Management ออกจากกันอย่างชัดเจน

Client / AI team
SDK · API · Job submission
Service endpoint
Inference request / response
GPU WORKER 01
Same-platform GPU group
GPUGPU
Platform interconnect
COMPUTE FABRIC
Between GPU groups
GPU WORKER 02
Same-platform GPU group
GPUGPU
Platform interconnect
SHARED STORAGE
Datasets · Models · Checkpoints
Dataset / CheckpointGPU collectiveInference requestInference response

Logical Flow ของ Cluster ที่ใช้ Platform เดียวกัน · Worker คือกลุ่มประมวลผล ไม่ใช่สเปก Rack หรือ Server · Fabric และ Protocol ยืนยันตาม Hardware และผลทดสอบ

Inside the platform

GB300 NVL72 ใช้ NVLink ภายใน Rack domain ส่วน MI350P เชื่อมผ่าน PCIe ตาม Host Topology จึงต้องออกแบบและทดสอบการสื่อสารให้ตรง Platform

Between GPU workers

เมื่อขยายข้าม Server หรือ Rack ให้ประเมิน Scale-out Fabric เช่น Ethernet/RDMA หรือ InfiniBand ตาม Compatibility ของ Platform และ Collective Library โดยไม่รวม GPU ต่างค่ายไว้ใน Collective เดียวกัน

Data & control separation

แยก Storage Traffic และ Management Access ในแบบระบบ เพื่อจัด Capacity, Access Policy และการติดตามปัญหาได้ตรงจุด

ENGINEERED / INSTALLED / VALIDATED

จาก Hardware สู่ระบบ
ที่ทีมคุณนำไปใช้งานต่อได้

ทีม Ruk-Com ช่วยเชื่อมรายละเอียดทุกชั้น ตั้งแต่ Rack, OS และ Driver ไปจนถึง Network, Runtime และการทดสอบด้วยงานจริง พร้อมส่งมอบ Configuration และ Runbook

OS & GPU enablement

ติดตั้ง OS และ Driver ตามค่ายที่เลือก ตรวจ Firmware, CUDA สำหรับ NVIDIA หรือ ROCm/HIP สำหรับ AMD รวม Container Runtime พร้อมบันทึก Compatibility Matrix

Network & cluster integration

วาง IP Plan, VLAN, Routing และ Fabric Connectivity ทดสอบเส้นทางระหว่าง GPU Workers และการเชื่อมต่อ Storage

Scheduler & orchestration

ออกแบบการจัดคิวและทรัพยากรด้วย Kubernetes หรือ Slurm ตามรูปแบบงาน รวมสิทธิ์ผู้ใช้ Quota และการส่ง Job

Data pipeline & recovery

จัดพื้นที่ Dataset, Model และ Checkpoint กำหนด Retention, Backup และขั้นตอน Restore แยกจากวงจร Training

Workload validation

ทดสอบ GPU Health, Burn-in และ Collective ด้วย NCCL สำหรับ NVIDIA หรือ RCCL สำหรับ AMD เมื่อ Configuration รองรับ พร้อมวัด Data Pipeline และ Model จริงตามเกณฑ์ PoC

Secure operations

กำหนด Administrative Access, Secrets และ Change Window พร้อม Monitoring, Alert และช่องทาง Escalation ถึง Engineer

Software, License, Integration และระดับ Support เลือกตาม Workload และข้อเสนอ ไม่ใช่รายการที่รวมทุก Solution โดยอัตโนมัติ

RUK-COM DATACENTER / COLOCATION

มีเครื่องของคุณอยู่แล้ว?
นำมาวาง พร้อมต่อเป็น Cluster

ต่อยอดจากการเช่าทรัพยากร สู่บริการฝากวาง GPU Server ขององค์กรใน Ruk-Com Datacenter พร้อมทีมประเมิน Power, Cooling, Rack และ Network เพื่อให้การติดตั้งเป็นแผนเดียวกับการใช้งาน

RUK-COM DATACENTERGPU DEPLOYMENT / FACILITY READINESS
Rack & Power

ประเมินขนาดเครื่อง น้ำหนัก และกำลังไฟของ Configuration จริง

Cooling design

ตรวจวิธีระบายความร้อนและ Facility Interface ตามรุ่น Server

Private connectivity

วาง Network สำหรับ Cluster, Storage และระบบองค์กรที่ต้องเชื่อมต่อ

Installation & Remote Hands

ติดตั้ง เดินสาย ติดป้าย และประสานงานหน้างานตามขอบเขตบริการ

Engineer-led. AI-assisted.

ออกแบบ Observability และ Runbook ร่วมกับทีม Ruk-Com พร้อมประเมินการใช้ Ruk-Com Agent ช่วยวิเคราะห์สัญญาณและจัดลำดับการดูแล ภายใต้สิทธิ์และ Approval ที่กำหนด

Ruk-Com Agent

WORKLOAD FIT / BUSINESS OUTCOMES

Infrastructure สำหรับ
AI ที่มีงานจริงรออยู่

เริ่มจากขนาด Model, Dataset และเป้าหมายการใช้งาน แล้วค่อยกำหนด GPU, Network และ Storage ที่เหมาะสม

Training & fine-tuning

สำหรับทีมที่พัฒนา Model หรือปรับ Model ด้วยข้อมูลเฉพาะองค์กร ประเมิน Memory, Batch Size และเวลาที่ใช้ต่อรอบ

Inference & private AI

วาง Serving Stack สำหรับ API, Assistant และ AI ภายในองค์กร ประเมิน Latency, Concurrent Requests และสิทธิ์ข้อมูล

Research & AI platforms

จัด Cluster ให้หลายทีมใช้ผ่าน Queue, Project และ Resource Policy พร้อมข้อมูลการใช้งานเพื่อวางแผน Capacity

DELIVERY / EVIDENCE AT EVERY STEP

ทีมเดียว เชื่อมทุกขั้นตอน
ตั้งแต่ Design จนถึง Handover

ให้การลงทุนด้าน GPU มีขอบเขตงาน ผู้รับผิดชอบ และเกณฑ์ตรวจรับที่ชัดเจน พร้อมข้อมูลที่ทีมคุณใช้ดูแลระบบต่อได้

01

Discover & size

ทบทวน Workload, Model, Dataset และรูปแบบการเข้าถึง

สิ่งส่งมอบWorkload Profile และ Resource Sizing
02

Design & configure

ยืนยัน Hardware, Network, Storage และขอบเขตบริการ

สิ่งส่งมอบTopology และ Configuration ที่ตกลง
03

Install & validate

ติดตั้ง เชื่อมต่อ และทดสอบตาม Acceptance Criteria

สิ่งส่งมอบผลทดสอบและ Performance Baseline
04

Handover & operate

ส่งมอบเอกสาร สิทธิ์เข้าถึง และช่องทางประสานงาน

สิ่งส่งมอบRunbook และ Support Ownership

BEFORE YOU DEPLOY

สิ่งที่ควรชัดเจน
ก่อนเริ่ม GPU Project

เราเริ่มจากโจทย์ของคุณ แล้วออกแบบขอบเขตบริการให้ตรงกับการใช้งานจริง

GPU Compute ต่างจาก Dedicated Server และ Cluster อย่างไร?

GPU Compute เน้นทรัพยากรที่จัดสรรให้ Workload ส่วน Dedicated Server มีขอบเขตทั้งเครื่อง และ Dedicated Cluster ครอบคลุมหลาย Server พร้อม Fabric และระบบประกอบ รูปแบบ Isolation, สิทธิ์และขนาดทรัพยากรยืนยันในข้อเสนอ

เลือก GB300 NVL72 หรือ AMD MI350P อย่างไร?

เริ่มจาก Workload, Model Memory และ Software Stack แล้วทำ PoC เพื่อเทียบ Configuration ที่เหมาะสม GB300 NVL72 เป็น Rack-scale platform ส่วน MI350P เป็น PCIe GPU accelerator และ Halo Station ยังเป็น Prototype ทีมจะยืนยันรุ่นที่จัดหาได้ Capacity และระยะเวลาก่อนสั่งบริการ

รองรับทั้ง CUDA และ ROCm รวม Kubernetes หรือ Slurm ไหม?

มีบริการประเมินและติดตั้ง Stack ตาม Platform: CUDA/NCCL สำหรับ NVIDIA และ ROCm/HIP/RCCL สำหรับ AMD โดยตรวจ GPU, OS, Framework, Container Runtime และ Scheduler ที่รองรับ พร้อมระบุเวอร์ชัน License และผู้รับผิดชอบ ไม่ถือว่า CUDA Workload ย้ายไป AMD ได้ทันทีโดยไม่ตรวจสอบ

Cluster ต้องใช้ InfiniBand เสมอไหม?

ไม่เสมอไป ต้องพิจารณารูปแบบ Collective, Network Adapter, Switch, Software Stack และงบประมาณร่วมกัน ทีมช่วยออกแบบและทดสอบ Fabric ที่เหมาะกับ Configuration จริง

เมื่อเครื่องขัดข้อง Training จะทำต่อเองทันทีไหม?

ขึ้นอยู่กับ Framework, Scheduler และวิธีเก็บ Checkpoint ต้องออกแบบการบันทึกสถานะและขั้นตอน Restart หรือ Restore แยกต่างหาก ไม่ใช่การย้ายงาน GPU แบบต่อเนื่องโดยอัตโนมัติ

นำ GPU Server ขององค์กรไปฝากวางได้ไหม?

ได้ ทีมจะตรวจรุ่นเครื่อง กำลังไฟ วิธี Cooling ขนาด Rack และ Network ก่อนจัดแผนติดตั้ง พร้อมกำหนดขอบเขต Remote Hands และการประสานงานกับทีมของคุณ

NVIDIA + AMD / RUK-COM ENGINEERING

บอกโจทย์ AI ของคุณ
ให้เราวาง Infrastructure ไปด้วยกัน

ส่งรายละเอียด Model, Dataset, จำนวนผู้ใช้หรือขนาด Training Job พร้อมรูปแบบบริการที่สนใจ ทีม Ruk-Com จะช่วยประเมิน GPU, Network, Storage และการติดตั้งให้เป็น Solution เดียว