brief.ing.gg

BRIEFING

Speculative Decoding은 실제 체감 속도를 얼마나 바꾸는가

Speculative Decoding은 실제 체감 속도를 얼마나 바꾸는가

Scope

핵심 질문

Speculative Decoding의 이론적 이득이 실제 사용자 체감 latency로 이어지는 조건은 무엇인가?

Draft

실제 이득은 draft acceptance rate와 현재 병목에 달려 있어 고정된 배수로 말하기 어렵다.

잘 맞는 경우

작은 batch로 한두 사용자의 latency를 줄일 때, draft model이 target과 비슷한 토큰을 자주 제안하면 한 번의 target forward에서 여러 토큰을 확정할 수 있다.

이득이 작은 경우

서버가 이미 큰 continuous batch로 GPU를 가득 활용하고 있다면 draft 계산과 verification overhead 때문에 상대적 이득이 줄 수 있다.

모델 관계

Draft가 너무 약하면 rejection이 많고, 너무 크면 draft 자체 비용이 커진다.

체감

Time to first token과 전체 응답 지연은 draft 실행방식, batch, 런타임과 부하에 따라 서로 다르게 변할 수 있다. 이후 token generation이 빨라져 긴 출력에서 이득이 생길 가능성은 있지만, 첫 토큰이 거의 그대로인지와 실제 체감 이득은 같은 환경에서 TTFT·전체 지연을 따로 측정해야 한다.

결론

Speculative Decoding은 무조건 2배 빨라지는 기능이 아니라 낮은 batch와 높은 acceptance라는 조건이 맞을 때 decoding latency를 줄이는 기법이다.