토큰과 컨텍스트 윈도우
요금과 한도가 왜 그렇게 정해지는가
① 컨텍스트 윈도우는 모델의 기억이 아니라 그릇이다. 매번 대화 전체를 통째로 다시 넣는 구조라, 대화가 길어질수록 매 턴의 비용이 올라간다.
② 길이가 늘 때 비용이 비례해서 오르지 않는다. 어텐션은 길이의 제곱으로 연산이 늘어난다 — 2배 길어지면 4배다. "긴 문서는 왜 이렇게 느리고 비싼가"의 답이 여기 있다.
③ "컨텍스트 100만 토큰"은 담을 수 있는 양이지 찾아낼 수 있는 능력이 아니다. 담기는 것과 중간부를 정확히 회수하는 것은 서로 다른 문제다.
① 토큰은 글자도 단어도 아니다
LLM 작동 원리에서 본 대로, 모델은 글자를 직접 다루지 못하고 토큰이라는 조각으로 쪼개 번호를 붙인다. 이 글이 이어서 다루는 건 그 다음 질문이다 — 왜 요금과 한도가 하필 이 단위로 매겨지는가.
이유는 단순하다. 모델이 실제로 처리하는 최소 단위가 토큰이기 때문이다. 글자 수로 요금을 매기면 언어마다 계산이 달라지고, 단어 수로 매기면 모델 내부의 실제 작업량과 어긋난다. 토큰은 모델이 하는 일의 양을 가장 정직하게 세는 단위다.
대부분의 AI 서비스는 토크나이저 도구를 공개한다. 실제로 쓰는 문장을 넣어보면 감이 잡힌다. 중요한 건 정확한 숫자를 외우는 게 아니라, 내가 자주 쓰는 종류의 글이 대략 몇 토큰인지를 한 번 재보는 것이다. 그 감각이 있으면 비용도 한도도 예측 가능해진다.
② 컨텍스트 윈도우는 '기억'이 아니라 '그릇'이다
가장 흔한 오해가 여기 있다. 대화를 이어가면 모델이 앞의 내용을 기억한다고 생각하기 쉽지만, 실제로는 그렇지 않다.
모델은 매 턴마다 백지 상태에서 시작한다. 대신 서비스가 지금까지의 대화 전체를 다시 붙여서 통째로 밀어 넣는다. 열 번째 질문을 하면, 첫 질문부터 아홉 번째 답변까지가 전부 다시 입력된다.
| 컨텍스트 윈도우에 들어가는 것 | 흔한 오해 |
|---|---|
| 시스템 프롬프트 (서비스가 미리 넣는 지시) | 사용자 눈에 안 보이지만 자리를 차지한다 |
| 지금까지의 대화 전체 | "기억"이 아니라 매번 재전송된다 |
| 첨부한 문서·이미지 | 첨부는 한 번이지만 이후 턴마다 계속 포함된다 |
| 이번 질문 | — |
| 모델이 생성할 답변 | 출력도 같은 한도를 나눠 쓴다 |
마지막 줄이 특히 중요하다. 컨텍스트 윈도우는 입력 전용이 아니다. 입력으로 그릇을 거의 채우면 답변이 들어갈 자리가 남지 않아, 답이 중간에 잘리거나 아예 짧아진다. 긴 문서를 넣었을 때 요약이 유난히 성의 없어 보인다면 이 때문일 수 있다.
대화가 길어질수록 매 턴 다시 밀어 넣는 양이 늘어난다. 20턴째 질문은 짧아도, 실제로는 앞의 19턴 전체를 다시 처리하는 비용이 든다. 주제가 바뀌면 새 대화를 시작하는 게 속도와 비용 양쪽에 유리하다. 이건 절약 요령이 아니라 구조에서 나오는 결론이다.
③ 한국어가 더 비싼 이유
같은 뜻의 문장이라도 한국어가 영어보다 토큰을 더 쓴다. 흔히 1.5–2배 수준으로 알려져 있는데, 원인은 모델의 성능이 아니라 토크나이저가 학습된 데이터의 구성이다.
토크나이저는 학습 데이터에서 자주 등장한 덩어리를 하나의 토큰으로 묶는다. 영어가 압도적으로 많은 데이터로 만들어졌다면, 영어 단어는 통째로 한 토큰이 되는 반면 한국어는 자모나 짧은 조각으로 잘게 쪼개진다. 여기에 조사·어미 변화가 많은 한국어 특성이 겹친다.
대량 처리에서는 이 차이가 그대로 비용이 된다. 영어로 넣고 결과만 한국어로 받는 방식이 더 쌀 수 있다. 다만 번역 과정에서 뉘앙스가 깎이므로, 문장의 결이 중요한 작업에는 권하지 않는다. 어느 쪽이 나은지는 직접 테스트해보는 편이 정확하다.
④ 왜 길어질수록 급격히 비싸지나 — 제곱 비용
여기가 이 글에서 가장 실용적인 부분이다. 길이가 2배가 되면 비용도 2배일 것 같지만, 실제로는 그렇지 않다.
어텐션은 각 토큰이 다른 모든 토큰을 얼마나 참고할지 계산하는 연산이다. 토큰이 100개면 100×100 = 1만 쌍, 200개면 200×200 = 4만 쌍이다. 길이가 2배가 되면 연산은 4배가 된다. 이게 어텐션의 제곱(길이²) 비용이다.
| 입력 길이 | 어텐션 계산 쌍 | 배수 |
|---|---|---|
| 1,000 토큰 | 100만 | 기준 |
| 2,000 토큰 | 400만 | 4배 |
| 4,000 토큰 | 1,600만 | 16배 |
| 10,000 토큰 | 1억 | 100배 |
실제 서비스 요금은 이 곡선을 그대로 반영하지 않는다. 여러 최적화 기법이 들어가고, 대개 토큰당 단가로 단순하게 청구한다. 하지만 왜 긴 입력이 유난히 느린지, 왜 컨텍스트 한도를 무한정 늘리지 못하는지는 이 구조에서 나온다.
긴 컨텍스트와 에이전트가 늘어난다는 건 처리해야 할 토큰이 제곱으로 늘어난다는 뜻이다. AI 인프라 투자가 학습(training)뿐 아니라 추론(inference) 쪽에서도 계속 커지는 이유가 여기 있다 — 배경은 반도체 섹터 전망에서, 그 투자가 어떤 자금 구조로 돌아가는지는 AI 순환금융 해부에서 다뤘다.
⑤ "컨텍스트 100만 토큰" 광고를 읽는 법
모델 발표마다 컨텍스트 한도가 커진다. 숫자만 보면 "이제 책 한 권을 통째로 넣어도 되겠다" 싶지만, 한 가지를 구분해야 한다.
담을 수 있는 양과 찾아낼 수 있는 능력은 다른 문제다. 한도가 크다는 건 입력이 거부되지 않는다는 뜻이지, 그 안의 모든 내용을 고르게 활용한다는 보장이 아니다.
긴 입력에서 모델은 앞부분과 끝부분은 잘 붙잡는 반면 중간은 놓치는 경향이 있다. 그래서 한도 수치보다 실제 회수 능력이 중요하다. 확인 방법은 간단하다 — 긴 문서 한가운데에 특징적인 문장을 하나 심어두고 그것에 대해 물어보는 것이다. 이 테스트와 문서 종류별 대처법은 AI에게 문서를 읽히는 법에서 자세히 다뤘다.
정리하면 컨텍스트 한도는 필요조건이지 충분조건이 아니다. 100만 토큰이 들어간다고 100만 토큰을 다 이해한다는 뜻은 아니다.
⑥ 실전 — 토큰을 아끼는 다섯 가지
구조를 알면 절약 방법도 요령이 아니라 원리에서 나온다.
- 주제가 바뀌면 새 대화로 — 가장 효과가 크다. 앞 대화 전체가 매 턴 재전송되는 걸 끊는다.
- 문서는 필요한 부분만 — 200쪽 PDF 전체보다 관련 20쪽이 빠르고 정확하다. 중간부 손실 위험도 함께 줄어든다.
- 출력 자리를 남겨둘 것 — 입력으로 그릇을 꽉 채우면 답변이 잘린다. 긴 답이 필요하면 입력을 줄인다.
- 긴 대화는 중간에 요약해 새로 시작 — 지금까지의 결론만 정리해 새 대화에 넘기면 맥락은 유지하면서 길이를 초기화할 수 있다.
- 대량 처리는 언어를 계산에 넣을 것 — 반복 작업이라면 한국어·영어 비용 차이가 누적된다.
컨텍스트 윈도우는 모델이 기억하는 공간이 아니라 매번 새로 채워 넣는 그릇이다. 이 하나만 바꿔 이해해도 — 왜 긴 대화가 느려지는지, 왜 답이 잘리는지, 왜 큰 한도가 만능이 아닌지가 전부 같은 원리에서 설명된다.
※ 본 글은 2026년 8월 기준 일반 원리를 설명한 교육 자료입니다. 토큰 단가·컨텍스트 한도는 서비스와 모델마다 다르고 자주 바뀌므로, 실제 수치는 각 서비스의 공식 문서에서 확인하시기 바랍니다.
※ 본 가이드는 일반 교육 목적의 참고 자료이며, 이해를 돕기 위해 기술적 세부사항을 단순화했습니다.
새 가이드가 나오면 알려드립니다
AI 리터러시 가이드는 주 2회 발행합니다. 구독하시면 다음 편을 메일로 보내드립니다. 무료이고 언제든 해지할 수 있습니다.
