AI · LLM 학습
대규모 언어모델 학습을 위한 멀티 GPU 클러스터
수십억~조 단위 파라미터 모델을 학습하려면 GPU 개수보다 GPU 사이를 잇는 대역폭이 성능을 좌우합니다. NVLink로 완전 연결된 노드 내부와 InfiniBand로 묶인 노드 사이, 두 계층 모두 설계가 필요합니다.
학습 클러스터는 장비를 들여놓는 것보다 전력과 냉각이 먼저 막히는 경우가 많습니다. 도입 전 랙 전원 용량과 냉각 방식을 함께 확인해 실제로 가동 가능한 구성을 제안합니다.
도입 전 확인할 것
이 워크로드에서 실제로 성능을 좌우하는 지점들입니다.
01
GPU 간 대역폭
노드 내부는 NVLink, 노드 간은 InfiniBand. 어느 한쪽이 병목이면 GPU를 더 넣어도 학습 시간이 줄지 않습니다.
02
데이터 공급 속도
GPU가 데이터를 기다리며 노는 경우가 흔합니다. 스토리지 대역폭을 GPU 수에 맞춰 산정해야 합니다.
03
전력·냉각
8-GPU 노드는 랙 전원 설계를 다시 하게 만듭니다. 장비 선정과 동시에 검토가 필요합니다.
추천 구성
이 워크로드에 자주 제안하는 제품입니다. 실제 구성은 규모와 예산에 따라 조정합니다.
NVIDIA 주문 생산
NVIDIA HGX B200
Blackwell 세대 플래그십 — 대규모 LLM 학습·추론용 8-GPU 베이스보드
- GPU 메모리
- 1,440GB HBM3e (8× 180GB)
- NVLink 대역폭
- 1.8TB/s per GPU
- 아키텍처
- Blackwell
BigFrog 주문 생산
8-GPU 학습 서버
HGX 기반 8-GPU 노드 — 대규모 학습 클러스터의 기본 단위
- GPU
- HGX B200 / H200 8-GPU
- 폼팩터
- 8U 랙마운트
- 네트워크
- InfiniBand NDR 지원
BigFrog 수급 문의
고성능 NVMe 스토리지
GPU를 굶기지 않는 학습 데이터 스토리지
- 구성
- 올-NVMe
- 프로토콜
- NFS over RDMA / 병렬 FS
- 확장
- 스케일아웃