한 줄 정의
Transformer는 문장 안의 모든 단어가 서로 얼마나 관련 있는지(self-attention)를 한 번에 계산해 처리하는 신경망 구조로, 2017년 공개된 이후 거의 모든 주요 LLM의 기반이 됐습니다.
지금 상태 (2026-09 기준)
Transformer는 순환신경망(RNN)처럼 단어를 하나씩 순서대로 처리하지 않고, 문장 전체를 한 번에 놓고 어떤 단어가 어떤 단어와 관련 있는지 병렬로 계산합니다. 이 덕분에 대량의 데이터를 GPU로 빠르게 학습시킬 수 있게 됐고, 이것이 2020년대 초 "모델을 더 크게, 데이터를 더 많이"라는 scaling law 경쟁의 물리적 토대가 됐습니다. 이후 모델을 무조건 키우기보다 데이터 양과 모델 크기를 함께 늘려야 한다는 것(Chinchilla, 2022)이 밝혀졌고, 모든 파라미터를 매번 다 쓰지 않고 필요한 부분만 골라 쓰는 Mixture-of-Experts(MoE) 구조가 대형 모델의 효율화 수단으로 자리잡았습니다.
개념
- self-attention: 문장의 각 단어가 다른 모든 단어와 "얼마나 관련 있는지"를 점수로 계산해, 그 점수만큼 서로의 정보를 섞는 메커니즘. 이 계산이 입력 길이의 제곱에 비례해 늘어나는 것이 LLM의 컨텍스트 창 크기 제한과 비용 문제의 근본 원인입니다(응용 차원의 대응은 컨텍스트 엔지니어링 (Context Engineering) 참고).
- scaling law(2020): OpenAI 연구진(Kaplan et al.)이 모델 크기·데이터양·연산량을 늘릴수록 성능(loss)이 예측 가능한 방식으로 좋아진다는 것을 실증. "일단 크게 만들면 좋아진다"는 업계 통념의 근거가 됐습니다.
- Chinchilla 재조정(2022): DeepMind가 같은 연산량이면 모델만 키우기보다 데이터도 비례해서 늘려야 더 좋은 성능이 나온다는 것을 보여주며 Kaplan의 법칙을 수정. 이후 대형 모델들이 데이터 양을 함께 늘리는 방향으로 훈련 전략을 바꿨습니다.
- Mixture-of-Experts(MoE): 모델 전체 파라미터 중 입력마다 일부(전문가 몇 개)만 골라 계산에 쓰는 구조. 전체 파라미터는 크지만 실제 연산량(활성 파라미터)은 작게 유지해, 큰 모델을 상대적으로 싼 비용에 돌릴 수 있게 합니다. Mixtral 8x7B가 오픈 가중치로 이 구조를 대중화했습니다.
벤더별 비교
| 구분 | 특징 |
|---|---|
| Google (Transformer 원 논문) | self-attention만으로 시퀀스 처리, RNN·CNN 제거 |
| OpenAI (scaling law) | 모델·데이터·연산량과 성능의 관계를 실증적으로 정식화 |
| DeepMind (Chinchilla) | 같은 연산 예산이면 데이터도 모델 크기만큼 늘려야 한다고 재정의 |
| Mistral AI (Mixtral) | MoE 구조를 오픈 가중치·Apache 2.0으로 대중화 |
잘 쓰는 법
- 모델 이름 뒤의 파라미터 수(예: "70B")만 보고 크기를 비교하지 않습니다. MoE 구조는 전체 파라미터와 실제로 계산에 쓰이는 활성 파라미터가 다르므로, "전체 몇 B, 활성 몇 B"를 함께 확인해야 실제 연산 비용을 가늠할 수 있습니다.
- 컨텍스트 창이 길수록 좋다고 단정하지 않습니다. self-attention의 계산 비용이 길이의 제곱에 비례해 늘어나므로, 실제로 필요한 길이인지부터 따집니다.
- "더 큰 모델이 항상 더 낫다"는 2020년대 초 통념은 Chinchilla 이후 깨졌습니다. 같은 크기라도 더 좋은 데이터로 학습한 모델이 더 잘할 수 있습니다.
타임라인
2017-06-12 · Transformer 구조 공개 ("Attention Is All You Need")
- 이전 대비: 최초 등장. RNN·CNN 기반 시퀀스 모델을 self-attention만으로 대체하는 구조를 처음 제시
- Google 연구진(Vaswani et al.)이 발표. NeurIPS 2017에서 공식 발표됨
- 출처: Attention Is All You Need (arXiv)
2020-01-23 · Scaling Laws 논문 공개
- 이전 대비: Transformer 구조 자체의 변화는 아니지만, "왜 크게 만들면 좋아지는지"를 처음 정량적으로 정식화해 이후 대형 모델 경쟁의 이론적 근거가 됨
- OpenAI 연구진(Kaplan et al.)이 모델 크기·데이터·연산량과 loss의 관계를 멱법칙으로 제시
- 출처: Scaling Laws for Neural Language Models (arXiv)
2022-03-29 · Chinchilla 논문 공개, Scaling Law 재조정
- 이전 대비: Kaplan의 scaling law가 모델 크기 위주로 해석되던 것을, "데이터양도 모델 크기만큼 늘려야 한다"는 방향으로 수정
- DeepMind가 70B 파라미터 Chinchilla 모델을 Gopher(280B)보다 4배 많은 데이터로 학습시켜, 더 적은 파라미터로도 더 좋은 성능을 낼 수 있음을 실증
- 출처: Training Compute-Optimal Large Language Models (arXiv)
2023-12-11 · Mixtral 8x7B 공개 (Mistral AI)
- 이전 대비: MoE 구조를 오픈 가중치·permissive 라이선스로 처음 대중화. 이전까지 MoE는 주로 폐쇄형 모델의 비공개 구현으로만 알려져 있었음
- 8개 전문가 중 토큰마다 2개를 골라 쓰는 구조로, 전체 46.7B 파라미터 중 토큰당 약 12.9B만 활성화. Apache 2.0 라이선스로 공개, Llama 2 70B보다 빠른 추론 속도를 주장
- 출처: Mixtral of experts (Mistral AI), Mixtral of Experts (arXiv)
출처
- Vaswani et al., "Attention Is All You Need", arXiv, 2017-06-12 (https://arxiv.org/abs/1706.03762)
- Kaplan et al., "Scaling Laws for Neural Language Models", arXiv, 2020-01-23 (https://arxiv.org/abs/2001.08361)
- Hoffmann et al., "Training Compute-Optimal Large Language Models", arXiv, 2022-03-29 (https://arxiv.org/abs/2203.15556)
- Mistral AI, "Mixtral of experts", 2023-12-11 (https://mistral.ai/news/mixtral-of-experts/)
- Jiang et al., "Mixtral of Experts", arXiv, 2024-01 (https://arxiv.org/abs/2401.04088)