wikiline.dev🇰🇷
Wikiline › AI (Artificial Intelligence) › LLM (Large Language Model)

LLM (Large Language Model)

Updated 2026-09-27

An AI model that generates sentences by predicting the next word

One-line definition

An LLM (Large Language Model) is a neural network trained on vast amounts of text to probabilistically predict the "next word (token)." Names like GPT, Claude, Gemini, Llama, and DeepSeek are all individual models built on this architecture, and the "AI agent" is an execution loop that uses an LLM as its brain to call tools.

Full timeline and sources below are currently in Korean.

지금 상태 (2026-09 기준)

  • 2017년 구글이 발표한 Transformer 구조(self-attention) 이후 거의 모든 주요 LLM이 이 구조를 기반으로 합니다. 초기에는 모델과 데이터를 얼마나 키우느냐(scaling laws)가 성능을 좌우했습니다.
  • 2024~2025년부터 경쟁의 축이 "더 크게"에서 "답하기 전에 더 오래 생각하게"로 옮겨갔습니다. OpenAI의 o1(2024-09)과 DeepSeek의 R1(2025-01)이 이 "추론 모델" 흐름을 대표합니다.
  • 텍스트 전용이던 모델에 이미지를 나중에 붙이는 방식(GPT-4V, 2023-09)에서, 처음부터 텍스트·이미지·오디오를 한 모델로 함께 학습하는 방식(Gemini, GPT-4o)으로 넘어갔습니다.
  • 폐쇄형 API로만 제공되는 모델(Claude, GPT, Gemini 계열)과 가중치를 내려받아 직접 돌릴 수 있는 모델(Llama, Mistral, DeepSeek, Qwen 등)의 성능 격차가 좁혀지는 중이며, "오픈소스"라는 말을 두고는 2024년 10월 처음으로 업계 공식 정의(OSI)가 나왔습니다.

개념

LLM이라는 한 주제를 네 개의 축으로 나눠 봅니다.

  • 구조와 학습(트랜스포머 (Transformer)): 모델이 물리적으로 어떻게 생겼고, 어떤 데이터·연산량으로 학습되는지. Transformer 구조, scaling law, Mixture-of-Experts 같은 효율화 기법을 다룹니다.
  • 사고 과정(추론 모델 (Reasoning Models)): 모델이 답을 내기까지 거치는 과정. 프롬프트에 예시를 넣어 유도하는 chain-of-thought부터, 아예 "오래 생각하도록" 강화학습으로 훈련된 추론 모델까지.
  • 다루는 형태(멀티모달 LLM): 텍스트만 다루던 모델이 이미지·오디오·영상까지 하나의 모델 안에서 처리하게 된 과정.
  • 공개 방식(오픈 가중치 모델 (Open-Weight Models)): 모델 가중치를 누가, 어떤 조건으로 공개하는지. "오픈소스"와 "오픈 웨이트"의 차이, 라이선스 스펙트럼.

"LLM으로 무엇을 만드느냐"(도구 연결, 지침 파일, 멀티에이전트 등)는 이 문서의 범위가 아니라 AI 에이전트 스택에서 다룹니다. 반대로 "매 호출마다 컨텍스트 창에 무엇을 채우고 지울지"라는 응용 전략은 컨텍스트 엔지니어링 (Context Engineering)에서 다루며, 이 문서에서는 그 밑바탕이 되는 모델 자체의 구조(컨텍스트 창을 만드는 attention 메커니즘)만 짚습니다.

벤더별 비교

구분 Anthropic OpenAI Google Meta Mistral AI DeepSeek
대표 계열 Claude GPT, o-시리즈 Gemini Llama Mistral, Mixtral DeepSeek-V, DeepSeek-R1
공개 방식 폐쇄형 API 폐쇄형 API (2025-08 gpt-oss를 Apache 2.0 오픈 가중치로 별도 공개) 폐쇄형 API (2024-02부터 Gemma를 오픈 가중치로 별도 공개) 오픈 가중치 (커뮤니티 라이선스) 오픈 가중치 (Apache 2.0 다수) 오픈 가중치 (MIT 다수)
추론 모델 - o1, o3 계열 - - - R1 계열

Anthropic·Google도 비슷한 성격의 추론 기능을 두고 있다고 알려져 있으나, 구체적인 모델명과 공개일을 1차 출처로 확인하지 못해 표에는 넣지 않았습니다. 자세한 내용은 추론 모델 (Reasoning Models) 참고.

잘 쓰는 법

  • "이번 모델이 벤치마크 1위"라는 기사는 며칠 안에 뒤집힙니다. 순위보다 어떤 구조적 변화(추론 모델인가, 멀티모달인가, 컨텍스트 창 크기, 오픈 가중치인가)가 있었는지를 봅니다.
  • 상업적으로 모델을 쓸 때는 "오픈소스"라는 표현만 보지 말고 실제 라이선스 문서를 확인합니다. 가중치 공개와 완전한 오픈소스는 다릅니다(오픈 가중치 모델 (Open-Weight Models)).
  • 추론 모델은 답을 내기 전에 내부적으로 더 많은 토큰을 쓰므로, 같은 질문이라도 지연 시간과 비용이 일반 모델보다 클 수 있습니다.
  • 멀티모달 모델을 쓸 때는 "이미지를 이해만 하는지" 아니면 "음성으로 입출력까지 하는지"를 구분해야 합니다. 이름이 비슷해도 지원 범위가 다릅니다.

타임라인

2017-06-12 · Transformer 구조 공개 ("Attention Is All You Need")

  • 이전 대비: 최초 등장. 순환신경망(RNN) 없이 attention만으로 시퀀스를 처리하는 구조를 처음 제시
  • Google 연구진이 발표. 이후 거의 모든 주요 LLM이 이 구조를 기반으로 함
  • 출처: Attention Is All You Need (arXiv)

2022-01-28 · Chain-of-Thought 프롬프팅 논문 공개

  • 이전 대비: 모델 구조 변경 없이, 프롬프트에 중간 추론 과정 예시를 넣는 것만으로 복잡한 문제 풀이 성능이 오른다는 것을 실증
  • Google 연구진(Jason Wei 등)이 발표. 이후 "추론 모델"이라는 별도 카테고리가 생기기 전까지 표준적인 추론 유도 기법으로 자리잡음
  • 출처: Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (arXiv)

2022-11-30 · ChatGPT 공개

  • 이전 대비: 연구용 API로만 존재하던 LLM을 일반 대중이 쓰는 대화형 제품으로 전환
  • OpenAI가 무료 리서치 프리뷰로 공개. 역대 가장 빠르게 확산된 소비자 앱 중 하나로 꼽힘
  • 출처: Sam Altman, "Reflections"

2023-12-06 · Gemini 1.0 공개 (Google DeepMind)

  • 이전 대비: 텍스트 모델에 이미지 이해를 나중에 붙이는 방식(GPT-4V 등)과 달리, 처음부터 텍스트·이미지·오디오·영상을 함께 학습한 "네이티브 멀티모달" 모델 표방
  • Ultra·Pro·Nano 세 규모로 공개, Pro 버전이 곧바로 Bard에 탑재됨. 상세 경과는 멀티모달 LLM 참고
  • 출처: Google, "Introducing Gemini"

2024-09-12 · OpenAI o1-preview 공개

2025-01-20 · DeepSeek-R1 공개 (오픈 가중치)

출처