wikiline.dev
·

멀티모달 LLM

타임라인 4건업데이트 0건갱신 2026-09-27별칭: multimodal, 멀티모달, 멀티모달 모델, vision language model, VLM

한 줄 정의

멀티모달 LLM은 텍스트뿐 아니라 이미지·오디오·영상 같은 다른 형태의 정보도 같은 모델 안에서 이해하거나 생성할 수 있는 LLM입니다.

지금 상태 (2026-09 기준)

초기 접근은 텍스트와 이미지를 같은 벡터 공간에 대응시키는 방식(CLIP, 2021)에서 출발해, 텍스트 전용 LLM에 이미지 이해 기능을 나중에 붙이는 방식(GPT-4V, 2023-09)으로 이어졌습니다. 이후 처음부터 텍스트·이미지·오디오·영상을 함께 학습하는 "네이티브 멀티모달" 모델(Gemini, 2023-12)이 등장했고, 2024년 5월 GPT-4o는 오디오까지 입력·출력 모두를 하나의 모델이 실시간으로 처리하는 수준으로 발전시켰습니다. 2026년 현재 주요 프론티어 모델은 대부분 최소한 텍스트+이미지를 기본으로 다루며, 음성 실시간 대화까지 지원하는 모델도 늘고 있습니다.

개념

  • CLIP(2021): 이미지와 그 이미지를 설명하는 텍스트를 같은 벡터 공간에 대응시키도록 대조 학습(contrastive learning)시킨 모델. LLM 자체는 아니지만, 이후 여러 멀티모달 LLM이 이미지를 "이해"하는 데 쓰는 비전 인코더의 기반 아이디어가 됐습니다.
  • "나중에 붙이는" 방식(GPT-4V): 이미 학습된 텍스트 전용 LLM에 별도의 비전 인코더를 연결해 이미지 입력을 이해하게 만드는 방식. 텍스트 모델을 재학습하지 않고 기능을 확장할 수 있다는 장점이 있습니다.
  • "처음부터 함께 학습" 방식(Gemini): 텍스트·이미지·오디오·영상 데이터를 처음부터 하나의 모델에 함께 학습시키는 방식. 서로 다른 모달리티 간 정보를 더 깊이 연결할 수 있다고 주장되지만, 검증은 벤치마크마다 다릅니다.
  • 입출력 모두 멀티모달(GPT-4o): 이미지를 "이해"만 하던 것을 넘어, 텍스트·이미지·오디오를 입력과 출력 양쪽에서 하나의 모델이 처리하도록 만든 것. 별도의 음성인식(STT)·음성합성(TTS) 모델을 거치지 않아 응답 지연이 크게 줄었습니다(최소 232ms, 평균 약 320ms로 사람의 대화 반응 속도에 근접한다고 발표됨. 출처).

벤더별 비교

구분 OpenAI Google
접근 방식 텍스트 모델에 비전을 확장(GPT-4V) → 입출력 통합 옴니 모델(GPT-4o) 처음부터 여러 모달리티를 함께 학습(Gemini 1.0부터)
대표 시점 GPT-4V 2023-09, GPT-4o 2024-05 Gemini 1.0 2023-12
지원 모달리티(발표 시점 기준) 텍스트, 이미지, 오디오 텍스트, 이미지, 오디오, 영상

잘 쓰는 법

  • "멀티모달을 지원한다"는 말만으로 범위를 단정하지 않습니다. 이미지를 읽기만 하는지, 이미지를 생성도 하는지, 음성 입출력까지 되는지는 모델마다 다릅니다.
  • 실시간 음성 대화가 필요한 제품이라면 별도 STT/TTS 파이프라인을 조합할지, 입출력 통합 모델(GPT-4o류)을 쓸지부터 결정합니다. 후자는 지연은 줄지만 세부 음성 제어(속도, 톤 등)의 자유도는 파이프라인 방식보다 제한적일 수 있습니다.
  • 이미지 이해 성능은 해상도·이미지당 토큰 소비량에 영향을 받습니다. 큰 이미지를 다수 첨부하면 컨텍스트 예산을 빠르게 소진할 수 있습니다.

타임라인

2021-01-05 · CLIP 공개 (OpenAI)

  • 이전 대비: 최초 등장. 이미지와 텍스트를 같은 임베딩 공간에 대응시키는 대조 학습 방식을 제시, 이후 여러 멀티모달 모델의 비전 인코더 설계에 영향
  • 4억 개의 이미지-텍스트 쌍으로 자기지도학습, 별도 미세조정 없이 다양한 이미지 분류 작업에 적용 가능함을 시연
  • 출처: CLIP: Connecting text and images (OpenAI)

2023-09-25 · GPT-4V(ision) 공개 (OpenAI)

  • 이전 대비: 텍스트 전용이던 GPT-4에 이미지 입력 이해 기능을 추가한 확장판. 비전 인코더를 기존 언어 모델에 붙이는 방식
  • 사용자가 이미지에 대해 질문하면 GPT-4가 이를 분석해 답하는 기능을 ChatGPT에 우선 도입
  • 출처: GPT-4V(ision) system card (OpenAI)

2023-12-06 · Gemini 1.0 공개 (Google DeepMind)

  • 이전 대비: 기존 모델에 모달리티를 나중에 추가하는 방식에서, 처음부터 텍스트·이미지·오디오·영상을 함께 학습하는 "네이티브 멀티모달" 방식으로 설계 철학이 전환
  • Ultra·Pro·Nano 세 규모로 공개, Pro 버전이 곧바로 Bard에 탑재됨
  • 출처: Google, "Introducing Gemini"

2024-05-13 · GPT-4o 공개 (OpenAI)

  • 이전 대비: GPT-4V가 텍스트 모델에 이미지 "이해"만 더한 것과 달리, 텍스트·이미지·오디오를 입력과 출력 양쪽에서 하나의 모델이 처리하는 옴니(omni) 모델로 전환
  • 별도 STT/TTS 없이 오디오를 직접 처리해 음성 응답 지연을 평균 약 320ms까지 단축했다고 발표
  • 출처: Hello GPT-4o (OpenAI)

출처