GPU Saat Kiralama
NVIDIA H100, A100 ve H200 GPU'lara Slurm üzerinden saatlik erişim — derin öğrenme, LLM eğitimi ve bilimsel hesaplama için.
GPU Saat Kiralama
NVIDIA’nın en güncel veri merkezi GPU’larına (H200, H100, A100) saatlik erişim. Derin öğrenme model eğitimi, büyük dil modelleri (LLM), moleküler dinamik simülasyonu ve bilimsel hesaplama için ideal. Tüm GPU’lara Slurm iş kuyruğu üzerinden erişilir; CUDA, PyTorch ve TensorFlow ortamları önceden yapılandırılmıştır.
Mevcut GPU Platformları
| GPU Modeli | Bellek | Ara Bağlantı | Kullanım Alanı |
|---|---|---|---|
| NVIDIA H200 SXM5 | 141 GB HBM3e | NVLink + InfiniBand NDR | LLM eğitimi, büyük ölçekli simülasyon |
| NVIDIA H100 SXM5 | 80 GB HBM3 | NVLink + InfiniBand NDR | Derin öğrenme, transformer modelleri |
| NVIDIA H100 PCIe | 80 GB HBM2e | InfiniBand HDR | Genel amaçlı GPU hesaplama |
| NVIDIA A100 SXM4 | 80 GB HBM2e | NVLink + InfiniBand HDR | Bilimsel hesaplama, simülasyon |
Çok düğümlü GPU iş yükleri için NVLink bağlantılı 8-GPU konfigürasyonlar ve düğümler arası InfiniBand NDR ara bağlantı mevcuttur.
Tipik Kullanım Alanları
- Derin öğrenme modeli eğitimi — PyTorch FSDP ve DeepSpeed ile dağıtık eğitim
- Büyük dil modelleri (LLM) — LLaMA, Mistral gibi modellerin fine-tuning ve inference’ı
- Moleküler dinamik simülasyonu — GROMACS, NAMD, Amber GPU-hızlandırmalı hesaplama
- CFD hesaplamaları — ANSYS Fluent ve OpenFOAM GPU solver’ları
- Sismik veri işleme — Reverse Time Migration (RTM) ve Full Waveform Inversion
- Görüntü işleme ve bilgisayarlı görü — Büyük ölçekli görüntü analizi ve işleme
Slurm ile GPU İş Gönderimi
GPU kaynakları Slurm üzerinden GRES (Generic Resource) mekanizmasıyla yönetilir. Örnek iş gönderim betiği:
#!/bin/bash
#SBATCH --partition=gpu
#SBATCH --gres=gpu:h100:4
#SBATCH --ntasks=1
#SBATCH --cpus-per-task=32
#SBATCH --time=24:00:00
module load pytorch/2.4.0
srun python train.py
Kullanım raporu, GPU-saat tüketiminizi model ve proje bazında detaylandırarak her ay otomatik iletilir.