Nvidia 공식 아카데미에서 제공하는 무료 강의 공부 후 키워드 위주로 정리한 내용입니다.(AI Network 코스)
1. 요약
• InfiniBand 기본 개념 & 툴 • DMA, RDMA, PKey/Partition, Adaptive Routing, IB Router, Subnet Manager 등. • ibdiagnet, ibnetdiscover, ibping, ib_write_bw, ibstat, ibpathverify, sminfo 등 InfiniBand 유틸리티 사용 목적. • Spectrum-X (Ethernet AI Fabric) • SN5600/Spectrum-4, RoCE Adaptive Routing/Performance Isolation, congestion 평가 방식, rail-optimized topology 등. • NetQ / UFM / Telemetry / WJH • NetQ의 역할(패브릭 검증, Flow Analysis, Adaptive Routing 모니터링 등). • UFM Telemetry / Enterprise / Cyber-AI 구분, UFM Traffic Map 사용하는 경우. • WJH(What Just Happened) 기능, Cumulus 스위치에서 모니터링 가능한 레이어. • BlueField DPU & DOCA • BlueField 동작 모드(DPU mode 등), DOCA 업그레이드 절차, BlueField가 담당하는 오프로드(보안·네트워킹·PCC). • Cumulus Linux / NVUE / MLNX-OS / Ansible • Cumulus 업그레이드 시 백업해야 하는 디렉터리, bond 설정 명령, EVPN Multi-homing, NVUE ignore 설정 의미. • MLNX-OS 계정 타입(admin/monitor). • NVUE Ansible Collection roles. • NVIDIA Air / CloudAI Benchmark / Network Operator 등 관리·시뮬레이션 도구 • Air에서 링크 정의 문법, Air+NetQ로 digital twin 검증. • CloudAI Benchmark로 성능 baseline. • Kubernetes용 Network Operator 역할. • GPU-accelerated Networking / NVLink / NCCL • NVLink 목적, NCCL-SHARP, PXN, IB Router 지원 환경 변수, GPU-accelerated networking의 이점. • Multi-tenancy / 보안 (PKey, VRF, BlueField) • InfiniBand PKey full/limited membership 조합, UFM RBAC, Spectrum-X에서 L3VNI/VRF로 테넌트 분리. • BlueField로 보안·프라이버시, dedicated storage fabric 필요성. 이 정도로만 머릿속에 카테고리 만들어두면, 각 문제를 어느 “상자”에 넣어야 할지 정리가 됩니다.
2. 각 주제별 핵심 포인트
InfiniBand 기본 & 툴 • 핵심 개념 • DMA: CPU 개입 없이 장치 간 메모리 전송, CPU 오버헤드 감소·지연 감소·대역폭 증가. • RDMA: 원격 메모리를 직접 읽고 쓰는 기술, CPU 부하 줄이고 전송 지연을 크게 줄여 AI/HPC에 필수. • PKey(Partition): InfiniBand에서 multi-tenancy와 트래픽 격리를 위한 논리 파티션, full vs limited membership. • Adaptive Routing: 현재 혼잡 상태에 따라 동적으로 경로를 선택해, 대역폭 활용 극대화. • IB Router: 여러 InfiniBand 서브넷을 연결해서 서로 통신할 수 있게 하는 장비. • 대표 툴 & 용도 • ibdiagnet: 패브릭 전체 진단·오류 탐지·리포트, 라우팅 검증까지 수행. • ibnetdiscover: 패브릭 토폴로지 디스커버리, LID/링크 속도 등 포함한 맵 생성. • ibping: InfiniBand용 ping, 기본 연결성 테스트. • ib_write_bw: 두 엔드포인트 간 RDMA write 대역폭 측정 (속도 검증용). • ibstat -d mlx5_X: InfiniBand 인터페이스 상태/링크 레이어 확인. • sminfo + smpquery ND <LID>: 현재 마스터 Subnet Manager가 어느 서버인지 LID→호스트명 추적. • 시험 팁 예시 • “전체 패브릭 헬스/리포트” = ibdiagnet, “토폴로지/포트/LID/속도 맵” = ibnetdiscover, “대역폭 측정” = ib_write_bw, “ICMP 같은 연결성 테스트” = ibping 으로 자동 매핑되게 외우기.
Spectrum-X & RoCE / Congestion Control • 스위치 & 하드웨어 • SN5600 (Spectrum-4): 64포트 800GbE, 총 51.2Tb/s, Spectrum-X 레퍼런스 아키텍처의 핵심. • Spectrum-3: 400Gb/s Ethernet 스위칭 제공 (AI 워크로드용 고속 이더넷). • Adaptive Routing & Congestion • Spectrum-X에서 혼잡 평가는 “각 포트 egress queue load 분석 → 가장 부하 적은 포트 선택”. • RoCE Adaptive Routing: 링크 장애나 혼잡시에도 최적 경로로 자동 우회하여 성능 유지. • Congestion Control 알고리즘 실행 주체는 BlueField-3 SuperNIC (초당 수백만 이벤트 처리). • Congestion이 발생하는 이유 : microburst, incast, low entropy(트래픽의 다양성이 낮음) 트래픽으로 인한 링크 부하분산 • 레퍼런스 아키텍처 요구사항 • Spectrum-X RA에서 Adaptive Routing: SN5600 + BlueField-3 SuperNIC + DDR(Dynamic Datagram Routing) + RoCE 트래픽 조합.
NetQ / UFM / Telemetry / WJH • NetQ • 역할: 패브릭 구성 자동 검증, 실시간 헬스 모니터링, Adaptive Routing 효과 분석, Flow Analysis. • Flow Analysis 전제조건: Cumulus 5.x 이상 + Spectrum-2 이상 스위치 + LCM 활성화. • Air와 연동: Air에서 구성한 디지털 트윈에 NetQ로 CI/CD 테스트 & 검증. • Telemetry 소스: WJH, DOCA Telemetry, Behavioral Telemetry까지 결합해서 서버·애플리케이션 root cause 추적. • WJH (What Just Happened) • 목적: “왜 패킷이 드롭됐는지” 맥락 포함해서 알려주는 기능. • L1/L2/L3, 터널, 버퍼, ACL 관련 문제까지 모니터링·텔레메트리 제공 (Cumulus WJH 서비스). • UFM (Unified Fabric Manager) • Telemetry: 실시간 성능·포트 카운터·케이블 정보 수집. • Enterprise: 전체 InfiniBand 환경 관리·최적화. • Cyber-AI: AI 기반으로 이상행위 분석, 보안 위협·장애 가능성 예측. • Network Traffic Map: 혼잡/지연, 설정 변경 후 영향, 작업 분산 최적화에는 유용하지만, 단일 노드 하드웨어 장애에는 덜 유용.
BlueField DPU & DOCA • BlueField DPU 역할 • 보안·네트워킹·스토리지 처리 offload → CPU는 AI 연산에 집중. • 데이터 암호화, 방화벽, 침입 탐지 등을 DPU에서 처리해 데이터 프라이버시·보안 강화. • 모드 • DPU mode: ARM 코어가 NIC 데이터 경로를 소유하지만, 호스트에서 DPU OS 접근 가능. • DOCA 업그레이드 • 업그레이드 전: /usr/sbin/ofed_uninstall.sh -force 실행해 기존 OFED 제거가 필수.
Cumulus Linux / NVUE / MLNX-OS / Ansible • Cumulus 업그레이드 • 반드시 마이그레이션/백업할 디렉터리: /etc/network (인터페이스), /etc/cumulus/acl (ACL), 기타 /etc 전체가 중요하지만 시험은 이 둘을 정답으로 요구. • EVPN Multi-homing • Cumulus Linux에서 active-active 서버 이중화 제공, 별도 inter-switch 링크 없이 EVPN MH로 구현. • NVUE • bond 설정: nv set interface bond1 bond mode lacp (bond1을 LACP로 설정). • “Linux 파일 무시” 설정 이유: 일부 설정을 NVUE 아닌 flat-file/Ansible로 유지하고 싶을 때, NVUE가 덮어쓰지 못하게 하려는 것. • MLNX-OS 계정 • admin: 전체 설정 변경 가능, monitor: 조회만 가능한 계정. • Ansible NVUE Collection • pre-built roles: 여러 스위치 모델에 공통 설정을 쉽게 적용하도록 미리 만들어 둔 역할 세트.
NVIDIA Air / CloudAI Benchmark / Network Operator • NVIDIA Air • 역할: Spectrum-X 네트워크를 디지털 트윈으로 시뮬레이션하는 클라우드 기반 도구. • 링크 정의 문법 예: "spine-01":"swp01" -- "gpu-leaf-01":"swp41". • NetQ와 함께 CI/CD 테스트 및 구성을 검증하는 용도. • CloudAI Benchmark • Spectrum-X 환경에서 throughput·latency 등 성능 지표 측정해서 baseline 만들 때 사용. • Network Operator (Kubernetes) • 역할: Kubernetes 클러스터에서 Spectrum-X 기반 네트워킹 구성 자동화, RDMA·GPUDirect RDMA 활성화 포함.
GPU-accelerated Networking / NVLink / NCCL • NVLink • GPU 간 고속, 저전력 인터커넥트, 멀티 GPU AI 워크로드 스케일링에 필수. • NCCL 관련 • SHARP 사용 시: NCCL_COLLNET_ENABLE=1, NCCL_SHARP_AUTOINIT=1 필요. • PXN: GPU↔NIC 통신 효율 개선. • multi-subnet InfiniBand: NCCL_IB_USE_IB_ROUTER 등으로 IB Router 지원 → 서브넷 간 집단 통신 가능. • GPU-accelerated Networking 효과 • GPU에서 네트워킹 일부를 처리해 지연 감소, 대역폭 향상 → 학습/추론 속도 향상.
Multi-tenancy / 보안 (PKey, VRF, BlueField) • InfiniBand PKey 멤버십 • full membership: 같은 PKey 내 full 및 limited 모두와 통신 가능. • limited membership: full 멤버와만 통신, 동일 limited끼리는 통신 불가. • 스토리지 공유·테넌트 간 격리 시: 스토리지 = full, 각 테넌트 GPU = limited. • Spectrum-X 네트워크 격리 • L3VNI per VRF: VRF마다 L3 VNI로 테넌트 격리. • VRF 자체가 테넌트별 네트워크 분리의 핵심 기능. • BlueField & 보안 데이터 암호화, 방화벽, 마이크로세그멘테이션 등 인프라 작업을 offload해 금융·규제 환경에서 프라이버시·보안 요구를 만족.