brief.ing.gg

BRIEFING

Q4·Q8·FP8 양자화는 무엇을 잃고 무엇을 얻는가

Q4·Q8·FP8 양자화는 무엇을 잃고 무엇을 얻는가

Scope

핵심 질문

Q4, Q8, FP8은 메모리와 속도를 얻는 대신 모델 품질과 hardware compatibility에서 어떤 차이를 만드는가?

Draft

정밀도를 낮추면 가장 먼저 얻는 것은 VRAM과 memory bandwidth다.

Q8

8-bit weight quantization은 원본 FP16/BF16 대비 weight 메모리를 줄일 수 있다. 품질 차이는 모델, quantizer, calibration과 평가 작업에 따라 달라지므로 '항상 작다'고 일반화하지 않고 실제 작업으로 비교한다.

Q4

약 4-bit로 낮추면 weight 저장량을 더 줄여 제한된 VRAM에서 큰 모델을 시도할 수 있다. reasoning, code, 작은 model에서의 손실 정도는 양자화 방식과 실제 평가 작업에 따라 검증해야 한다.

FP8

FP8은 부동소수점 형식이다. 해당 FP8 연산 경로를 지원하는 GPU·커널·런타임에서 weight뿐 아니라 activation과 matrix compute 최적화의 후보가 될 수 있지만, 지원되지 않는 환경에서 속도 이점을 단정할 수 없다.

결론

Q4는 weight 용량 절감, Q8은 상대적으로 높은 정밀도 유지, FP8은 지원 hardware의 연산 경로가 가능한 선택지다. 실제 품질·지연·처리량은 모델과 quantizer, 데이터, 런타임·하드웨어를 명시해 같은 작업으로 비교해야 한다.