brief.ing.gg

BRIEFING

NVLink는 LLM 추론에서 실제로 얼마나 도움이 되는가

NVLink는 LLM 추론에서 실제로 얼마나 도움이 되는가

Scope

핵심 질문

멀티 GPU LLM 추론에서 NVLink의 효과는 어떤 병렬화 방식에서 커지고 언제 거의 의미가 없는가?

Draft

NVLink의 효과는 GPU 수가 아니라 GPU 사이에 얼마나 자주 데이터를 교환하는가에 달려 있다.

Tensor Parallelism

매 Transformer layer마다 collective communication이 발생하므로 interconnect bandwidth가 중요하다. 이 경우 NVLink가 PCIe 대비 latency와 처리량을 크게 개선할 수 있다.

Layer Split

앞쪽 layer를 GPU 0, 뒤쪽을 GPU 1에 두는 방식은 activation이 경계에서 이동하는 정도라 통신 빈도가 낮다. NVLink의 이득이 상대적으로 작을 수 있다.

단일 GPU

모델이 한 GPU에 들어간다면 NVLink는 추론에 아무 역할도 하지 않는다.

결론

NVLink는 VRAM을 마법처럼 합치는 기능이 아니라 multi-GPU communication 병목을 줄이는 기술이다. Tensor Parallel처럼 통신이 많은 구조일수록 가치가 커진다.