GPU Saat Kiralama

NVIDIA H100, A100 ve H200 GPU'lara Slurm üzerinden saatlik erişim — derin öğrenme, LLM eğitimi ve bilimsel hesaplama için.

GPU Saat Kiralama

NVIDIA’nın en güncel veri merkezi GPU’larına (H200, H100, A100) saatlik erişim. Derin öğrenme model eğitimi, büyük dil modelleri (LLM), moleküler dinamik simülasyonu ve bilimsel hesaplama için ideal. Tüm GPU’lara Slurm iş kuyruğu üzerinden erişilir; CUDA, PyTorch ve TensorFlow ortamları önceden yapılandırılmıştır.

Mevcut GPU Platformları

GPU ModeliBellekAra BağlantıKullanım Alanı
NVIDIA H200 SXM5141 GB HBM3eNVLink + InfiniBand NDRLLM eğitimi, büyük ölçekli simülasyon
NVIDIA H100 SXM580 GB HBM3NVLink + InfiniBand NDRDerin öğrenme, transformer modelleri
NVIDIA H100 PCIe80 GB HBM2eInfiniBand HDRGenel amaçlı GPU hesaplama
NVIDIA A100 SXM480 GB HBM2eNVLink + InfiniBand HDRBilimsel hesaplama, simülasyon

Çok düğümlü GPU iş yükleri için NVLink bağlantılı 8-GPU konfigürasyonlar ve düğümler arası InfiniBand NDR ara bağlantı mevcuttur.

Tipik Kullanım Alanları

  • Derin öğrenme modeli eğitimi — PyTorch FSDP ve DeepSpeed ile dağıtık eğitim
  • Büyük dil modelleri (LLM) — LLaMA, Mistral gibi modellerin fine-tuning ve inference’ı
  • Moleküler dinamik simülasyonu — GROMACS, NAMD, Amber GPU-hızlandırmalı hesaplama
  • CFD hesaplamaları — ANSYS Fluent ve OpenFOAM GPU solver’ları
  • Sismik veri işleme — Reverse Time Migration (RTM) ve Full Waveform Inversion
  • Görüntü işleme ve bilgisayarlı görü — Büyük ölçekli görüntü analizi ve işleme

Slurm ile GPU İş Gönderimi

GPU kaynakları Slurm üzerinden GRES (Generic Resource) mekanizmasıyla yönetilir. Örnek iş gönderim betiği:

#!/bin/bash
#SBATCH --partition=gpu
#SBATCH --gres=gpu:h100:4
#SBATCH --ntasks=1
#SBATCH --cpus-per-task=32
#SBATCH --time=24:00:00

module load pytorch/2.4.0
srun python train.py

Kullanım raporu, GPU-saat tüketiminizi model ve proje bazında detaylandırarak her ay otomatik iletilir.

Öne Çıkan Özellikler

Güncel NVIDIA GPU'lar

NVIDIA H200 (141 GB HBM3e), H100 SXM5/PCIe (80 GB) ve A100 SXM4 (80 GB) GPU'lara saatlik erişim. En büyük LLM eğitimi ve bilimsel hesaplama iş yükleri için yeterli bellek bant genişliği ve kapasite sağlanır.

Slurm GRES Yönetimi

GPU kaynakları Slurm üzerinden GRES mekanizmasıyla yönetilir; #SBATCH --gres=gpu:h100:4 gibi direktiflerle GPU tahsisi yapılır. Kuyruk politikaları, zamanlama ve önceliklendirme otomatik olarak işlenir.

Dağıtık Eğitim Altyapısı

NVLink bağlantılı 8-GPU düğümler ve düğümler arası InfiniBand NDR ara bağlantı ile PyTorch FSDP ve DeepSpeed dağıtık eğitim çalışmaları verimli şekilde ölçeklenir. Çok düğümlü işlerde yüksek iletişim bant genişliği elde edilir.

Hazır Yazılım Ortamları

CUDA, PyTorch, TensorFlow ve NVIDIA HPC SDK modül olarak önceden yapılandırılmıştır. GROMACS, NAMD, Amber, ANSYS Fluent ve OpenFOAM GPU hızlandırmalı hesaplamalar için hazır ortamlar sunulur.

Sık Sorulan Sorular

Yalnızca tükettiğiniz GPU-saat üzerinden faturalandırılırsınız; GPU'nun tahsis edildiği ancak kullanılmadığı süreler ücretlendirilmez. Her ay sonunda kullanımınız model ve proje bazında detaylandırılmış bir raporla otomatik iletilir.

Evet. Tek bir iş içinde #SBATCH --gres=gpu:h100:4 direktifiyle bir düğümde 8'e kadar GPU, birden çok düğümde ise InfiniBand NDR üzerinden çok sayıda GPU tahsis edilebilir. NVLink ve düğümler arası yüksek bant genişliği dağıtık eğitim için tasarlanmıştır.

LLM fine-tuning ve inference için H200 veya H100 SXM5 önerilir; büyük model eğitiminde 141 GB HBM3e belleği ile H200 en uygun seçimdir. Bilimsel simülasyon ve genel amaçlı hesaplama için A100 SXM4 ve H100 PCIe ekonomik alternatifler sunar.

Birlikte Geleceği İnşa Edelim.