한 줄 정의
추론 모델은 질문에 바로 답하지 않고, 내부적으로 여러 단계의 중간 사고 과정(chain-of-thought)을 거친 뒤 답을 내도록 강화학습으로 훈련된 LLM입니다. 이 "더 오래 생각하기"에 쓰는 연산을 test-time compute라고 부릅니다.
지금 상태 (2026-09 기준)
2022년 초까지 "단계별로 생각해봐" 식으로 예시를 프롬프트에 넣어 모델의 추론을 유도하는 chain-of-thought는 순전히 프롬프트 기법이었습니다. 2024년 9월 OpenAI가 이 사고 과정을 프롬프트가 아니라 모델 자체의 학습된 능력으로 만든 o1을 공개하면서, 답변 전 내부 추론에 더 많은 토큰(=더 많은 연산, test-time compute)을 쓸수록 성능이 좋아진다는 것을 상용 제품으로 보여줬습니다. 2025년 1월에는 DeepSeek가 같은 성격의 모델(R1)을 MIT 라이선스 오픈 가중치로 공개해, 추론 모델이 특정 회사의 폐쇄형 API에만 갇힌 기술이 아님을 증명했습니다. 추론 모델은 일반 모델보다 답변 지연과 토큰 비용이 크다는 트레이드오프가 있습니다.
개념
- chain-of-thought(2022): 프롬프트에 "단계별로 생각하는" 예시를 몇 개 넣으면, 모델이 복잡한 산수·논리 문제를 훨씬 잘 푼다는 것을 실증한 프롬프트 기법. 모델 구조나 학습 방식은 그대로이며, 입력을 바꾸는 것만으로 성능이 오른다는 점이 핵심이었습니다.
- 학습된 추론으로의 전환(2024): OpenAI o1은 chain-of-thought를 프롬프트로 유도하는 대신, 강화학습으로 "스스로 여러 방법을 시도하고 실수를 알아채는" 사고 과정 자체를 모델에 학습시켰습니다. 이 때문에 같은 질문이라도 모델이 내부적으로 쓰는 토큰 수(=사고 시간)가 문제 난이도에 따라 달라집니다.
- test-time compute: 모델을 훈련할 때 쓰는 연산(train-time compute)과 별개로, 실제 답변을 생성하는 순간에 얼마나 많은 연산(=긴 사고 과정)을 쓰느냐도 성능을 좌우하는 축이라는 개념. o1이 상용 제품으로 처음 이를 증명했습니다.
- 순수 강화학습만으로 학습(DeepSeek-R1-Zero): DeepSeek는 사람이 만든 예시로 먼저 가르치는 지도학습(SFT) 단계 없이, 강화학습만으로 추론 능력을 학습시킨 R1-Zero를 함께 공개했습니다. 이후 초기 데이터를 약간 더해 성능을 다듬은 것이 정식 R1입니다.
- 컨텍스트와의 관계: 추론 모델의 긴 사고 과정 자체가 컨텍스트 창을 차지하는 토큰이므로, 얼마나/어떻게 그 사고 흔적을 남기거나 지울지는 컨텍스트 엔지니어링 (Context Engineering)에서 다루는 컨텍스트 관리 문제와 직접 연결됩니다.
벤더별 비교
| 구분 | OpenAI | DeepSeek |
|---|---|---|
| 대표 모델 | o1(2024-09 preview, 2024-12 정식), o3 계열 | R1, R1-Zero (2025-01) |
| 공개 방식 | 폐쇄형 API | 오픈 가중치, MIT 라이선스 |
| 학습 방식 | 강화학습 기반(세부 비공개) | 강화학습 기반, R1-Zero는 SFT 없이 순수 RL만 사용 |
| 비고 | 정식 출시와 함께 $200 ChatGPT Pro 티어 신설 | 671B 파라미터 MoE, 활성 파라미터 37B |
Google·Anthropic도 자사 모델에 비슷한 성격의 추론 기능을 두고 있다고 알려져 있습니다. 다만 구체적인 모델명과 공개일을 1차 출처로 확인하지 못해 표에는 넣지 않았습니다.
잘 쓰는 법
- 추론 모델은 일반 모델보다 응답이 느리고 토큰 비용이 큽니다. 복잡한 다단계 추론이 필요한 문제에만 골라 쓰는 편이 비용 효율적입니다.
- "몇 위 벤치마크"보다 "이 모델이 프롬프트 유도형 chain-of-thought인지, 학습으로 내재화된 추론 모델인지"를 먼저 구분합니다. 후자는 프롬프트를 아무리 바꿔도 사고 과정 자체를 끄고 켤 수 없는 경우가 많습니다.
- 오픈 가중치 추론 모델(R1 계열)을 자체 인프라에서 돌릴 때는 사고 과정 토큰까지 포함한 실제 출력 길이를 기준으로 비용을 계산합니다.
타임라인
2022-01-28 · Chain-of-Thought 프롬프팅 논문 공개
- 이전 대비: 최초 등장. 모델을 재학습하지 않고 프롬프트 예시만으로 복잡한 문제 풀이 성능을 끌어올릴 수 있음을 처음 실증
- Google 연구진(Jason Wei 등)이 발표. 이후 2년 넘게 추론 유도의 표준 기법으로 쓰임
- 출처: Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (arXiv)
2024-09-12 · OpenAI o1-preview 공개
- 이전 대비: 프롬프트 기법이던 chain-of-thought를 강화학습으로 모델에 내재화한 최초의 상용 모델. "test-time compute"라는 축을 처음 상용 제품으로 증명
- 답변 전 내부적으로 여러 단계를 거쳐 사고하도록 훈련됨. 과학·코딩·수학 문제에서 이전 모델 대비 향상을 주장
- 출처: OpenAI, "Introducing OpenAI o1-preview", OpenAI, "Learning to reason with LLMs"
2024-12-06 · o1 정식 출시 + ChatGPT Pro 신설
- 이전 대비: preview 딱지를 뗀 정식 버전으로 전환, $200/월의 최상위 유료 티어(ChatGPT Pro) 신설
- 출처: OpenAI, "Introducing OpenAI o1-preview"(모델 계열 후속 공지 참고)
2025-01-20 · DeepSeek-R1 공개 (오픈 가중치)
- 이전 대비: 폐쇄형 API로만 존재하던 추론 모델을 MIT 라이선스 오픈 가중치로 공개, 지도학습 없이 순수 강화학습만으로 추론을 학습한 R1-Zero도 함께 공개
- 671B 파라미터 MoE 구조(활성 37B). 오픈 가중치 추론 모델이 폐쇄형 최상위 모델과 경쟁 구도를 형성한 첫 사례로 평가됨
- 출처: DeepSeek-R1 (Hugging Face), DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (arXiv)
출처
- Wei et al., "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models", arXiv, 2022-01-28 (https://arxiv.org/abs/2201.11903)
- OpenAI, "Introducing OpenAI o1-preview", 2024-09-12 (https://openai.com/index/introducing-openai-o1-preview/)
- OpenAI, "Learning to reason with LLMs" (https://openai.com/index/learning-to-reason-with-llms/)
- DeepSeek-R1, Hugging Face 모델 카드 (https://huggingface.co/deepseek-ai/DeepSeek-R1)
- Guo et al., "DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning", arXiv, 2025-01-22 (https://arxiv.org/abs/2501.12948)