wikiline.dev
·
Wikiline › AI (인공지능) › LLM (대규모 언어 모델) › 트랜스포머 (Transformer)

트랜스포머 (Transformer)

타임라인 4건업데이트 0건갱신 2026-09-27별칭: Transformer, 트랜스포머 구조, self-attention, 셀프 어텐션, scaling law, 스케일링 법칙

한 줄 정의

Transformer는 문장 안의 모든 단어가 서로 얼마나 관련 있는지(self-attention)를 한 번에 계산해 처리하는 신경망 구조로, 2017년 공개된 이후 거의 모든 주요 LLM의 기반이 됐습니다.

지금 상태 (2026-09 기준)

Transformer는 순환신경망(RNN)처럼 단어를 하나씩 순서대로 처리하지 않고, 문장 전체를 한 번에 놓고 어떤 단어가 어떤 단어와 관련 있는지 병렬로 계산합니다. 이 덕분에 대량의 데이터를 GPU로 빠르게 학습시킬 수 있게 됐고, 이것이 2020년대 초 "모델을 더 크게, 데이터를 더 많이"라는 scaling law 경쟁의 물리적 토대가 됐습니다. 이후 모델을 무조건 키우기보다 데이터 양과 모델 크기를 함께 늘려야 한다는 것(Chinchilla, 2022)이 밝혀졌고, 모든 파라미터를 매번 다 쓰지 않고 필요한 부분만 골라 쓰는 Mixture-of-Experts(MoE) 구조가 대형 모델의 효율화 수단으로 자리잡았습니다.

개념

  • self-attention: 문장의 각 단어가 다른 모든 단어와 "얼마나 관련 있는지"를 점수로 계산해, 그 점수만큼 서로의 정보를 섞는 메커니즘. 이 계산이 입력 길이의 제곱에 비례해 늘어나는 것이 LLM의 컨텍스트 창 크기 제한과 비용 문제의 근본 원인입니다(응용 차원의 대응은 컨텍스트 엔지니어링 (Context Engineering) 참고).
  • scaling law(2020): OpenAI 연구진(Kaplan et al.)이 모델 크기·데이터양·연산량을 늘릴수록 성능(loss)이 예측 가능한 방식으로 좋아진다는 것을 실증. "일단 크게 만들면 좋아진다"는 업계 통념의 근거가 됐습니다.
  • Chinchilla 재조정(2022): DeepMind가 같은 연산량이면 모델만 키우기보다 데이터도 비례해서 늘려야 더 좋은 성능이 나온다는 것을 보여주며 Kaplan의 법칙을 수정. 이후 대형 모델들이 데이터 양을 함께 늘리는 방향으로 훈련 전략을 바꿨습니다.
  • Mixture-of-Experts(MoE): 모델 전체 파라미터 중 입력마다 일부(전문가 몇 개)만 골라 계산에 쓰는 구조. 전체 파라미터는 크지만 실제 연산량(활성 파라미터)은 작게 유지해, 큰 모델을 상대적으로 싼 비용에 돌릴 수 있게 합니다. Mixtral 8x7B가 오픈 가중치로 이 구조를 대중화했습니다.

벤더별 비교

구분 특징
Google (Transformer 원 논문) self-attention만으로 시퀀스 처리, RNN·CNN 제거
OpenAI (scaling law) 모델·데이터·연산량과 성능의 관계를 실증적으로 정식화
DeepMind (Chinchilla) 같은 연산 예산이면 데이터도 모델 크기만큼 늘려야 한다고 재정의
Mistral AI (Mixtral) MoE 구조를 오픈 가중치·Apache 2.0으로 대중화

잘 쓰는 법

  • 모델 이름 뒤의 파라미터 수(예: "70B")만 보고 크기를 비교하지 않습니다. MoE 구조는 전체 파라미터와 실제로 계산에 쓰이는 활성 파라미터가 다르므로, "전체 몇 B, 활성 몇 B"를 함께 확인해야 실제 연산 비용을 가늠할 수 있습니다.
  • 컨텍스트 창이 길수록 좋다고 단정하지 않습니다. self-attention의 계산 비용이 길이의 제곱에 비례해 늘어나므로, 실제로 필요한 길이인지부터 따집니다.
  • "더 큰 모델이 항상 더 낫다"는 2020년대 초 통념은 Chinchilla 이후 깨졌습니다. 같은 크기라도 더 좋은 데이터로 학습한 모델이 더 잘할 수 있습니다.

타임라인

2017-06-12 · Transformer 구조 공개 ("Attention Is All You Need")

  • 이전 대비: 최초 등장. RNN·CNN 기반 시퀀스 모델을 self-attention만으로 대체하는 구조를 처음 제시
  • Google 연구진(Vaswani et al.)이 발표. NeurIPS 2017에서 공식 발표됨
  • 출처: Attention Is All You Need (arXiv)

2020-01-23 · Scaling Laws 논문 공개

  • 이전 대비: Transformer 구조 자체의 변화는 아니지만, "왜 크게 만들면 좋아지는지"를 처음 정량적으로 정식화해 이후 대형 모델 경쟁의 이론적 근거가 됨
  • OpenAI 연구진(Kaplan et al.)이 모델 크기·데이터·연산량과 loss의 관계를 멱법칙으로 제시
  • 출처: Scaling Laws for Neural Language Models (arXiv)

2022-03-29 · Chinchilla 논문 공개, Scaling Law 재조정

  • 이전 대비: Kaplan의 scaling law가 모델 크기 위주로 해석되던 것을, "데이터양도 모델 크기만큼 늘려야 한다"는 방향으로 수정
  • DeepMind가 70B 파라미터 Chinchilla 모델을 Gopher(280B)보다 4배 많은 데이터로 학습시켜, 더 적은 파라미터로도 더 좋은 성능을 낼 수 있음을 실증
  • 출처: Training Compute-Optimal Large Language Models (arXiv)

2023-12-11 · Mixtral 8x7B 공개 (Mistral AI)

  • 이전 대비: MoE 구조를 오픈 가중치·permissive 라이선스로 처음 대중화. 이전까지 MoE는 주로 폐쇄형 모델의 비공개 구현으로만 알려져 있었음
  • 8개 전문가 중 토큰마다 2개를 골라 쓰는 구조로, 전체 46.7B 파라미터 중 토큰당 약 12.9B만 활성화. Apache 2.0 라이선스로 공개, Llama 2 70B보다 빠른 추론 속도를 주장
  • 출처: Mixtral of experts (Mistral AI), Mixtral of Experts (arXiv)

출처