BRIEFING
Tensor Parallel과 GPU Split은 언제 각각 적합한가
Tensor Parallel과 GPU Split은 언제 각각 적합한가
Scope
핵심 질문
멀티 GPU 추론에서 Tensor Parallelism과 layer 기반 GPU Split을 어떤 목표에 따라 선택해야 하는가?
Draft
두 방식의 가장 큰 차이는 용량 확장과 연산 병렬화 중 무엇을 우선하느냐다.
GPU Split
모델 layer를 여러 GPU에 나눈다. 구현이 단순하고 서로 다른 크기의 GPU도 활용하기 쉽다. 큰 모델을 여러 VRAM에 나눠 싣는 것이 주목적이다.
단점은 한 token 계산이 GPU들을 순차적으로 거칠 수 있어 latency가 줄지 않을 수 있다는 점이다.
Tensor Parallel
한 layer의 matrix operation을 여러 GPU가 동시에 계산한다. GPU가 동일하고 interconnect가 빠를 때 throughput과 latency를 개선하기 좋다.
대신 매 layer collective communication이 필요하다.
선택
개인용으로 큰 모델 하나를 겨우 적재하는 것이 목표면 GPU Split이 실용적이다. 데이터센터형 homogeneous GPU에서 고성능 serving이 목표면 Tensor Parallel이 일반적으로 유리하다.
결론
GPU Split은 메모리 문제 해결, Tensor Parallel은 계산 병렬화가 중심이라고 보면 이해하기 쉽다.