WIKI
대규모 언어 모델 (LLM)
대규모 언어 모델 (LLM)
LLM은 어떤 방식으로 학습되고 추론하는가.
Scope
핵심 질문
대규모 언어 모델(LLM)은 어떤 구조로 학습되고, 입력 문맥을 이용해 다음 토큰을 생성하는가?
포함 범위
- Transformer 기반 언어 모델의 기본 구조
- 사전학습과 후속 정렬·미세조정
- 토큰화와 autoregressive generation
- 컨텍스트 윈도우와 추론 비용
- LLM의 강점과 근본적 한계
제외 범위
- 특정 모델의 최신 벤치마크 순위
- 모델별 라이선스·가격 비교
- 개별 서비스의 사용법
Research
핵심 근거
- 현대 LLM의 기본 구조는 Transformer 계열이며, self-attention을 이용해 입력 토큰 사이의 관계를 계산한다.
- causal language model은 주어진 문맥에서 다음 토큰의 확률분포를 예측하는 방식으로 학습되는 경우가 일반적이다.
- 사전학습 이후 instruction tuning, preference optimization, reinforcement learning 등으로 사용자 지시에 더 잘 반응하도록 조정할 수 있다.
- 생성 시에는 이미 생성된 토큰도 다시 문맥의 일부가 되므로 출력 길이가 길어질수록 추론 비용이 증가한다.
- 모델은 통계적 패턴을 학습하며 사실 데이터베이스처럼 동작하지 않으므로, 그럴듯하지만 틀린 출력을 만들 수 있다.
참고 자료
- Vaswani et al., Attention Is All You Need: https://arxiv.org/abs/1706.03762
- Brown et al., Language Models are Few-Shot Learners: https://arxiv.org/abs/2005.14165
- Ouyang et al., Training language models to follow instructions with human feedback: https://arxiv.org/abs/2203.02155
Draft
대규모 언어 모델(Large Language Model, LLM)은 매우 많은 텍스트를 학습해 주어진 문맥 다음에 올 토큰의 확률을 예측하는 모델이다. 오늘날의 LLM 대부분은 Transformer 계열 구조를 사용한다.
토큰과 다음 토큰 예측
LLM은 문장을 그대로 다루지 않고 텍스트를 토큰(token)이라는 단위로 나눈다. 토큰은 단어 전체일 수도 있고 단어의 일부, 문장부호, 숫자의 일부일 수도 있다.
모델은 앞에 주어진 토큰들을 바탕으로 다음 토큰이 무엇일지 확률을 계산한다. 하나의 토큰을 선택한 뒤 그 토큰을 다시 입력 문맥에 붙이고 다음 토큰을 예측한다. 이 과정을 반복하면 긴 문장이 생성된다.
따라서 겉으로는 질문에 답하고 추론하는 것처럼 보여도 가장 기본적인 생성 메커니즘은 문맥에 이어질 토큰을 순차적으로 예측하는 것이다.
Transformer와 Attention
Transformer의 핵심은 attention이다. attention은 현재 토큰을 처리할 때 입력의 다른 토큰 가운데 무엇을 얼마나 참고할지 계산하는 메커니즘이다.
이를 통해 모델은 문장에서 멀리 떨어진 단어 사이의 관계도 처리할 수 있다. 여러 층의 attention과 feed-forward network를 반복하면서 입력은 점차 추상적인 표현으로 바뀐다.
사전학습
사전학습에서는 대규모 텍스트를 이용해 언어의 통계적 구조를 학습한다. 이 과정에서 문법, 표현, 일반 지식, 코드 패턴, 어느 정도의 문제 해결 패턴까지 모델의 가중치에 반영된다.
하지만 사전학습만으로는 사용자의 지시에 안정적으로 따르지 않을 수 있다. 그래서 이후 instruction tuning이나 preference optimization 같은 후속 학습을 적용하는 경우가 많다.
컨텍스트 윈도우
LLM은 한 번에 무한한 텍스트를 볼 수 없다. 모델이 한 번의 추론에서 참고할 수 있는 토큰 범위를 컨텍스트 윈도우라고 한다.
컨텍스트가 길어지면 더 많은 이전 대화나 문서를 참고할 수 있지만 메모리와 연산 비용도 커진다. 실제 에이전트 시스템에서는 모든 정보를 무조건 넣기보다 어떤 정보를 유지하고 요약하거나 외부 저장소에서 다시 가져올지 설계하는 것이 중요하다.
LLM은 지식 데이터베이스가 아니다
LLM은 사실을 행 단위로 저장한 데이터베이스가 아니다. 학습 과정에서 텍스트 패턴이 모델 파라미터에 분산되어 표현된다.
그래서 매우 많은 사실을 재현할 수 있지만 존재하지 않는 사실을 자연스럽게 만들어낼 수도 있다. 최신 정보나 중요한 사실을 다룰 때 검색, 데이터베이스, 외부 도구와 결합하는 이유가 여기에 있다.
핵심
LLM은 거대한 텍스트 데이터에서 언어와 문제 해결 패턴을 학습한 확률 모델이다. Transformer와 attention이 문맥을 처리하고, 다음 토큰 예측을 반복해 출력을 생성한다. 높은 범용성이 장점이지만 정확한 사실 조회나 무한한 기억을 기본적으로 보장하는 시스템은 아니다.