Context Window 쉽게 이해하기: LLM의 단기 기억력과 한계 극복
거대언어모델(LLM)과 대화를 나누다 보면 어느 순간 모델이 이전 대화 내용을 잊어버리거나 동문서답을 하는 경험을 하게 됩니다. 이는 모델의 컨텍스트 윈도우(Context Window) 한계를 초과했기 때문입니다. AI의 '작업 기억 용량'이라고 할 수 있는 컨텍스트 윈도우의 개념과 중요성을 체계적으로 정리합니다[cite: 1, 3.
[Flowchar 컨텍스트 윈도우의 작동 원리와 한계
[입력 프롬프트 + 이전 대화 내역 ➔ [컨텍스트 윈도우 내 적재(메모리 한도) ➔ [초과 시: 오래된 정보 밀어내기/망각 발생 ➔ [결과: 환각(Hallucination) 또는 맥락 상실
컨텍스트 윈도우 용량 초과 시 발생하는 정보 손실 과정
1. 컨텍스트 윈도우(Context Window)란 무엇인가?
컨텍스트 윈도우는 모델이 한 번의 추론 과정에서 동시에 기억하고 참조할 수 있는 최대 토큰(Token)의 한도를 의미합니다[cite: 1, 3. 쉽게 말해 모델이 문서를 읽고 작업할 수 있는 '책상의 크기'이자 '단기 기억력'의 척도입니다.
- 포함 범위: 사용자가 입력한 프롬프트뿐만 아니라, 모델이 생성하는 출력 응답의 총합을 모두 포함하여 계산됩니다[cite: 1, 3, 6.
- 기억 용량의 척도: 컨텍스트 윈도우가 넓을수록 책 한 권 분량의 긴 문서나 장기적인 이전 대화 기록을 끊김 없이 참조하며 일관된 답변을 유지할 수 있습니다.
2. 컨텍스트 윈도우가 부족할 때 생기는 문제
모델의 지능이 아무리 높아도 컨텍스트 윈도우 크기를 벗어나는 정보는 처리할 수 없습니다.
- 맥락 상실 (Amnesia): 대화가 길어지거나 너무 긴 문서를 입력하면, 한도를 초과한 가장 오래된 앞부분의 텍스트 정보부터 잘려 나가며 기억을 상실하게 됩니다.
- 환각(Hallucination) 현상 증가: 참조해야 할 앞부분의 핵심 맥락이 삭제되면, 모델은 빈 공간을 통계적으로 그럴듯한 거짓 정보로 채워 넣어 사실과 다른 엉뚱한 답변을 생성하기 쉽습니다.
3. 컨텍스트 윈도우와 토큰의 관계 한눈에 보기
| 비교 항목 |
토큰 (Token) |
컨텍스트 윈도우 (Context Window) |
| 개념적 정의 |
텍스트 처리 및 연산의 최소 단위 조각[cite: 1, 3 |
모델이 한 번에 담을 수 있는 최대 토큰 수 한도[cite: 1, 3 |
| 비유적 표현 |
정보를 구성하는 '물방울' |
물방울을 담아두는 '물컵'의 크기 |
| 실무적 의미 |
글자 수·단어 단위에 따른 API 과금 기준 |
긴 문서 처리 능력, 대화 기억 유지 기간 |
4. 넓은 컨텍스트 윈도우의 실무 활용: RAG
최근 모델들의 컨텍스트 윈도우가 수십만 토큰 단위로 커지면서 검색 증강 생성(RAG, Retrieval-Augmented Generation) 기술의 활용도가 극대화되고 있습니다.
- 사내 규정이나 최신 PDF 문서 전체를 검색하여 추출된 방대한 관련 내용을 넓은 컨텍스트 윈도우 안에 통째로 주입할 수 있습니다.
- 모델은 자체적인 내부 가중치(파라미터)에 의존하지 않고, 입력된 문맥을 바탕으로 정확한 사실 기반 답변과 출처를 제시하여 환각을 획기적으로 억제합니다.

결론
아무리 훌륭한 논리력을 가진 LLM이라도 참조할 수 있는 기억 공간이 좁다면 제대로 된 능력을 발휘할 수 없습니다. 컨텍스트 윈도우의 한계를 명확히 이해하고, 긴 대화나 문서를 다룰 때 불필요한 프롬프트를 줄여 메모리를 효율적으로 관리하는 것이 고품질 AI 활용의 핵심입니다.
댓글목록
등록된 댓글이 없습니다.