One-line definition
The practice of designing, for every LLM call, "what stays in the context window and what gets summarized, deleted, or externalized" — going beyond writing one good prompt to managing the information budget of an entire conversation.
Full timeline and sources below are currently in Korean.
지금 상태 (2026-09 기준)
"컨텍스트 엔지니어링"이라는 용어는 2025년 6월 Andrej Karpathy가 "prompt engineering보다 정확한 표현"이라고 언급하며 업계에 퍼졌습니다. 같은 해 7월 Chroma가 "context rot"(입력이 길어질수록 모델이 정보를 고르게 활용하지 못하는 현상)을 실증 데이터로 제시했고, 9월 말 Anthropic이 Claude Sonnet 4.5와 함께 context editing(오래된 도구 결과 자동 정리)·memory tool(파일 기반 외부 메모리)을 공개하면서 "컨텍스트 엔지니어링"을 정식 실무 가이드로 문서화했습니다. 2026년 현재는 장시간 실행되는 에이전트(coding agent, 멀티스텝 워크플로)에서 컨텍스트 관리가 프롬프트 튜닝보다 더 중요한 성능 레버로 취급되는 분위기입니다.
개념
- prompt caching과의 관계(2024-08): 컨텍스트 엔지니어링이라는 말이 생기기 전에도, Anthropic의 프롬프트 캐싱은 "긴 컨텍스트를 반복 전송하는 비용/지연을 줄인다"는 문제를 다뤘다. 이는 컨텍스트를 "정보 예산"으로 보는 관점의 초기 형태로, 이후 컨텍스트 엔지니어링 논의의 경제적 배경이 됐습니다.
- 용어의 기원(2025-06): Karpathy는 "prompt"라는 말이 일상적 짧은 지시를 떠올리게 하는 반면, 실전 LLM 애플리케이션에서는 "컨텍스트 창을 무엇으로 채울지 정교하게 설계하는 과학기술"이 핵심이라며 "context engineering"이라는 표현을 제안했습니다. 이 표현이 빠르게 업계 표준 용어로 자리잡았습니다.
- context rot(2025-07): Chroma의 기술 리포트는 입력 토큰이 늘어날수록 모델이 컨텍스트를 균일하게 활용하지 못하고 성능이 저하된다는 것을 실증했습니다. 이는 "컨텍스트를 무제한 늘려도 안전하다"는 가정을 깨고, 컨텍스트를 신중히 큐레이션해야 한다는 논거의 핵심 근거가 됐습니다.
- compaction(요약 후 재시작): 대화가 컨텍스트 한도에 가까워지면 지금까지의 내용을 요약해 핵심(설계 결정, 미해결 버그 등)만 남기고 나머지를 버린 뒤 그 요약으로 새 세션을 이어가는 기법. 오래된 도구 호출 결과만 골라 지우는 것은 이보다 가벼운 형태의 정리로 취급됩니다.
- memory tool / 외부 메모리: 컨텍스트 창 자체가 아니라 파일 시스템 형태의 외부 저장소에 정보를 기록·조회하게 해, 세션이 끝나거나 컨텍스트가 비워져도 지식이 유지되도록 하는 접근. Claude Sonnet 4.5와 함께 퍼블릭 베타로 공개됐습니다.
- 범위 구분(instruction-files와의 차이): CLAUDE.md·AGENTS.md 같은 "고정 지침 파일"은 컨텍스트 엔지니어링의 한 재료로 쓰이지만, 그 자체는 별도 주제(프로젝트 지침 파일 (Project Instruction Files))로 다룹니다. 컨텍스트 엔지니어링은 그런 파일을 포함해 "무엇을 언제 컨텍스트에 넣고 뺄지"의 전체 전략을 가리킵니다.
[업데이트 2026-09-28] GitHub의 Agentic Autofix(보안 취약점 자동 수정 에이전트)가 Copilot Memory를 활용하도록 업데이트됨 — 취약점을 해결할 때 과거 세션에 저장된 관련 메모리를 참조해 컨텍스트로 삼는다. 세션 간 지식을 파일 기반 외부 메모리로 유지하는 접근이 코드 보안 자동화 영역까지 확장된 사례. (Agentic autofix now uses Copilot Memory)
벤더별 비교
| 구분 | Anthropic | 기타 |
|---|---|---|
| 공식 가이드 | Effective Context Engineering for AI Agents (2025-09-29) | OpenAI/Google은 별도의 공식 "context engineering" 문서 없이 자사 에이전트 SDK 문서 안에 컨텍스트 관리 팁을 분산 서술 |
| 제공 기능 | Context Editing(자동 정리), Memory Tool(파일 기반 외부 메모리) — 둘 다 퍼블릭 베타 | 각 벤더 SDK의 요약/트렁케이션 유틸리티 (표준 용어 없음) |
| 근거 연구 | 자체 엔지니어링 블로그 + Chroma의 Context Rot 리포트 인용 | — |
잘 쓰는 법
- 컨텍스트를 "다다익선"이 아니라 "유한한 예산"으로 취급 — Context Rot 연구가 보여주듯 길이가 늘어난다고 성능이 같이 늘지 않습니다.
- 예: 100개 파일짜리 레포에서 당장 안 쓸 파일 50개를 미리 읽어 컨텍스트에 쌓아두면, 정작 중요한 질문에 답할 때 그 파일들이 노이즈가 돼 오히려 답이 부정확해질 수 있습니다.
- 도구 호출 결과처럼 한 번 쓰고 재참조 빈도가 낮은 내용은 적극적으로 정리(context editing)하고, 설계 결정·미해결 이슈처럼 장기적으로 중요한 정보만 요약해 남깁니다(compaction).
- 예:
ls로 본 디렉터리 목록은 다음 턴에 또 안 쓰면 지워도 되지만, "이 API는 인증에 JWT를 쓰기로 했다" 같은 결정은 요약해서 남겨야 나중에 또 묻지 않습니다.
- 예:
- 세션을 넘어 유지해야 하는 지식(작업 이력, 팀 컨벤션 등)은 컨텍스트 창이 아니라 파일 기반 메모리 같은 외부 저장소로 옮겨 세션 종료·재시작에도 살아남게 합니다.
- 예: "이 프로젝트는 pnpm을 쓴다", "배포는 반드시 hk 승인 후"처럼 매번 알려주기 번거로운 규칙은 [instruction-files]나 memory tool에 한 번 적어두면 이후 세션마다 다시 설명할 필요가 없습니다.
- 프롬프트 캐싱을 쓰는 경우, 캐시 적중률을 위해 자주 바뀌지 않는 내용(시스템 프롬프트, 대형 참조 문서)을 앞쪽에 고정 배치하는 편이 유리합니다.
- 예: 시스템 프롬프트·레퍼런스 문서를 맨 앞에 고정하고 매번 바뀌는 사용자 질문을 맨 뒤에 두면 캐시가 재사용되지만, 순서가 뒤섞이면(질문을 앞에 끼워 넣는 식) 캐시가 매번 깨져 비용·지연이 늘어납니다.
- 긴 실행형 에이전트일수록 "몇 턴마다 무엇을 정리할지"에 대한 명시적 정책을 두는 것이 임시방편적 트렁케이션보다 안정적입니다.
- 예: "20턴마다 지금까지 내용을 요약하고 새 세션으로 이어간다" 같은 규칙을 코딩 에이전트에 심어두면, 컨텍스트가 꽉 차서 갑자기 느려지거나 끊기는 걸 예방할 수 있습니다.
타임라인
2024-08-14 · Anthropic 프롬프트 캐싱 출시
- 이전 대비: 최초 등장(선행 개념) — "컨텍스트 엔지니어링"이라는 말은 아직 없었지만, 긴 컨텍스트를 반복 전송하는 비용/지연 문제를 다룬 최초의 상업적 해법.
- 반복적으로 재사용되는 컨텍스트(시스템 프롬프트, 문서 등)를 캐싱해 비용과 지연을 크게 줄이는 기능을 Claude API에 추가.
- 출처: Prompt caching with Claude (Anthropic, 요약: Simon Willison)
2025-06-27 · "context engineering" 용어 확산 (Karpathy)
- 이전 대비: 프롬프트 캐싱 등 개별 기법으로 존재했던 관행에 "컨텍스트 엔지니어링"이라는 이름이 처음 널리 붙음.
- Andrej Karpathy가 X(트위터)에서 "prompt engineering"보다 "context engineering"이 더 정확한 표현이라고 제안, 업계 전반에서 빠르게 채택됨.
- 출처: Context engineering (Simon Willison, 2025-06-27)
2025-07-14 · Chroma "Context Rot" 기술 리포트
- 이전 대비: 용어 차원의 논의에서 "왜 컨텍스트를 무한정 늘리면 안 되는지"를 정량적으로 증명한 실증 연구로 발전.
- 입력 토큰이 길어질수록 모델이 컨텍스트를 균일하게 활용하지 못하고 성능이 비균일하게 저하된다는 것을 벤치마크로 제시.
- 출처: Context Rot: How Increasing Input Tokens Impacts LLM Performance (Chroma, 2025-07-14)
2025-09-29 · Anthropic "Effective Context Engineering for AI Agents" + Context Editing/Memory Tool 공개
- 이전 대비: 산발적 논의·연구였던 컨텍스트 엔지니어링을 Claude Sonnet 4.5 출시와 함께 정식 제품 기능(자동 정리, 파일 기반 메모리)과 공식 실무 가이드로 통합.
- Context Editing(오래된 도구 결과 자동 정리)과 Memory Tool(파일 기반 외부 메모리)을 퍼블릭 베타로 공개하고, 컴팩션·메모리·도구 결과 정리 등을 체계적으로 정리한 엔지니어링 블로그를 함께 발표.
- 출처: Effective context engineering for AI agents (Anthropic, 2025-09-29), Managing context on the Claude Developer Platform (Anthropic)
출처
- Prompt caching with Claude, Anthropic (요약: Simon Willison), 2024-08-14 (https://simonwillison.net/2024/Aug/14/prompt-caching-with-claude/)
- Context engineering, Simon Willison 블로그, 2025-06-27 (https://simonwillison.net/2025/Jun/27/context-engineering/)
- Andrej Karpathy, X(트위터) 포스트 (https://x.com/karpathy/status/1937902205765607626)
- Context Rot: How Increasing Input Tokens Impacts LLM Performance, Chroma, 2025-07-14 (https://www.trychroma.com/research/context-rot)
- Effective context engineering for AI agents, Anthropic, 2025-09-29 (https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents)
- Managing context on the Claude Developer Platform, Anthropic (https://www.anthropic.com/news/context-management)
- Agentic autofix now uses Copilot Memory, GitHub Changelog, 2026-09-25 (https://github.blog/changelog/2026-09-25-agentic-autofix-now-uses-copilot-memory)