GPTImproving Language Understanding by Generative Pre-TrainingGPT-1은 decoder-only Transformer를 언어 모델에 적용한 초기 GPT 계열 모델이다. 학습된 절대 위치 임베딩, MHA(Multi-Head Attention), dense FFN, GELU, LayerNorm을 사용했다. 오늘날의 LLM도 이 기본 골격을 대체로 유지하지만, 위치 표현·attention·FFN·normalization의 구성은 달라졌다.이 글에서는 GPT-1의 기본 구성을 기준으로, 현재 LLM에서 자주 볼 수 있는 대표적인 구조 변화를 정리한다.구성 요소GPT-1의 기본 구성이후의 대표적 변화위치 표현학습된 절대 위치 임베딩RoPEAttentionMHAMQ..