AI 환각은 왜 생기나
그리고 실무에서 걸러내는 5가지 방법
① 환각은 모델이 "거짓말"을 하는 게 아니라, 사실 여부를 판단하는 단계 자체가 파이프라인에 없기 때문에 생긴다. 확률이 높은 문장을 만들 뿐이다.
② 취약 지점은 세 곳으로 압축된다 — 숫자, 인용·출처, 최신 정보. 세 가지 모두 "형식은 완벽하고 내용만 틀린" 형태로 나타나서 눈으로는 안 걸린다.
③ 대응은 "더 좋은 모델"이 아니라 검증 절차다. 출처 요구 → 재질문 → 역질문 → 분할 → 외부 확인 5단계면 대부분 걸러진다.
① 환각은 버그가 아니다
"AI가 환각을 일으킨다"는 표현은 마치 정상 작동 중에 가끔 오류가 나는 것처럼 들린다. 실제로는 그 반대다. 모델은 항상 똑같은 일을 하고 있고, 그 일이 사실 확인이 아닐 뿐이다.
LLM 작동 원리에서 봤듯이, 모델의 유일한 작업은 "지금까지의 토큰 다음에 올 확률이 가장 높은 토큰"을 고르는 것이다. 이 과정 어디에도 "이게 실제로 맞나?"를 확인하는 단계가 없다. 사실인 문장이 자주 나오는 이유는 학습 데이터에 사실이 많았기 때문이지, 모델이 사실을 선호해서가 아니다.
존재하지 않는 논문 제목을 물어보면 모델은 "논문 제목처럼 생긴 토큰 배열"을 만든다. 형식이 전형적일수록 확률이 높으므로, 가장 자연스러워 보이는 가짜가 가장 잘 생성된다. "티가 나는 거짓말"보다 "티가 안 나는 거짓말"이 구조적으로 더 잘 나온다는 뜻이다.
② 세 가지 취약 지점
환각이 아무 데서나 균등하게 발생하는 건 아니다. 실무에서 문제가 되는 건 거의 항상 다음 세 가지다.
| 유형 | 왜 취약한가 | 전형적인 증상 |
|---|---|---|
| 숫자 | 숫자는 토큰으로 쪼개져 예측될 뿐, 계산되지 않는다 | 매출·점유율·연도가 그럴듯한 자릿수로 틀림 |
| 인용·출처 | 저자명+제목+연도 조합은 형식이 정형화돼 있어 조합이 쉬움 | 실존 저자 + 실존 학술지 + 가짜 논문 제목 |
| 최신 정보 | 학습 시점 이후 사건은 데이터에 없음 | 지난 분기 실적을 과거 패턴으로 "추정"해 서술 |
세 가지의 공통점이 중요하다. 형식은 완벽하고 내용만 틀린다. 문법 오류도, 이상한 어조도 없다. 그래서 읽어보고 판단하는 방식으로는 절대 걸러지지 않는다.
투자 판단에 쓰는 정보는 대부분 이 세 유형에 속한다 — 실적 수치, 리포트 인용, 최근 뉴스. AI에게 "엔비디아 지난 분기 매출 얼마야?"라고 물어 나온 숫자를 그대로 쓰면 위험하다. 실제 숫자는 빅테크 실적 해석 가이드처럼 원문 공시를 근거로 한 자료에서 확인해야 한다.
③ "확신에 차 보인다"는 신호가 아니다
많은 사람이 모델의 어조에서 신뢰도를 읽으려 한다. 단정적으로 말하면 맞는 것 같고, 머뭇거리면 틀린 것 같다. 이건 착각이다.
모델의 어조는 학습 데이터의 문체를 따라간 결과다. 백과사전 문체를 학습했으면 백과사전처럼 단정적으로 쓴다. 그 문장에 대한 내부 확률값이 얼마인지와는 아무 관계가 없다. 실제로 확률이 낮은 추측일수록 더 단정적으로 서술되는 경우도 흔하다 — 애매한 표현보다 단정적 표현이 학습 데이터에 더 많기 때문이다.
④ 걸러내는 5가지 방법
1. 출처를 함께 요구한다
"~에 대해 알려줘" 대신 "~에 대해 알려주고, 각 주장의 출처를 URL과 함께 명시해줘. 확실하지 않은 항목은 '불확실'로 표시해줘"라고 요구한다. 출처를 붙이라고 하면 두 가지가 일어난다. 실제 출처가 있는 내용은 검증 가능해지고, 없는 내용은 모델이 회피하거나 가짜 URL을 만들어낸다. 가짜 URL은 클릭 한 번으로 걸러진다 — 이게 핵심이다. 틀린 사실보다 틀린 URL이 훨씬 검증하기 쉽다.
2. 대화를 새로 시작해 다시 묻는다
같은 질문을 새 대화창에서 다시 던진다. 환각은 확률적 샘플링의 결과라 매번 다르게 나오는 경우가 많다. 두 번의 답이 숫자까지 일치하면 신뢰도가 올라가고, 다르면 최소한 하나는 틀렸다는 걸 알 수 있다. 같은 대화창에서 다시 물으면 앞의 답이 입력에 남아 있어 그대로 반복하므로 의미가 없다.
3. 역질문을 던진다
모델이 "A는 B다"라고 답했다면, 새 대화에서 "A가 B가 아니라는 근거를 대봐"라고 물어본다. 사실이라면 모델이 반박 근거를 잘 못 찾는다. 환각이었다면 반대 방향으로도 똑같이 그럴듯한 이야기를 만들어낸다. 양쪽 다 술술 나오면 그 주장은 신뢰할 수 없다.
4. 질문을 잘게 쪼갠다
"이 회사 재무 상태 분석해줘"처럼 큰 질문은 환각이 섞이기 쉽다. 여러 사실을 한 번에 생성하면서 중간에 어긋난 게 뒤로 누적되기 때문이다. "매출 추이만", "부채비율만" 처럼 쪼개서 물으면 각 답이 짧아져 검증하기 쉽고, 누적 오차도 줄어든다.
5. 숫자와 고유명사는 반드시 외부 확인
앞의 네 가지를 다 해도 숫자만은 원문에서 직접 확인해야 한다. 실적은 기업 IR 페이지나 SEC 공시, 주가는 거래소 데이터, 통계는 발표 기관 원문. 예외 없이 적용하는 게 좋다. AI가 잘하는 일은 "어디를 봐야 하는지 알려주는 것"이지 "숫자를 기억해주는 것"이 아니다.
□ 답변에 숫자가 있는가 → 원문 확인 전까지 사용 금지
□ 인용·논문·보고서가 있는가 → URL 직접 클릭
□ 학습 시점 이후 사건인가 → 검색 기능 사용 또는 폐기
□ 중요한 결론인가 → 새 대화에서 재질문 + 역질문
□ 답이 길고 복잡한가 → 쪼개서 다시 질문
⑤ RAG와 검색 연동은 얼마나 도움이 되나
최근 도구들은 답변 전에 웹을 검색하거나 문서를 찾아 근거로 삼는다. 이 방식을 RAG(검색 증강 생성)라고 한다. 실제로 환각을 크게 줄인다. 모델이 기억에서 끌어내는 대신 눈앞의 문서를 보고 답하기 때문이다.
다만 두 가지 새로운 실패 모드가 생긴다. 첫째, 검색 결과 자체가 틀릴 수 있다. 부정확한 블로그를 근거로 삼으면 출처가 붙어도 내용은 틀린다. 둘째, 근거 문서와 실제 답변이 어긋날 수 있다. 출처는 제대로 달렸는데 요약 과정에서 숫자가 바뀌는 경우가 있다.
그래서 출처가 달린 답변이라도 출처를 실제로 열어 해당 문장을 확인하는 습관이 필요하다. 출처의 존재는 검증의 시작이지 끝이 아니다.
⑥ 마무리 — 태도의 문제
환각을 대하는 가장 실용적인 태도는 AI를 "매우 유능하지만 출처를 기억하지 못하는 조수"로 보는 것이다. 구조를 잡고, 놓친 관점을 짚고, 초안을 빠르게 만드는 일은 훌륭하게 해낸다. 하지만 그 조수가 말한 숫자를 그대로 보고서에 옮기지는 않을 것이다.
정리하면 이렇다. AI에게 "무엇을 볼지"는 물어도 좋고, "무엇이 사실인지"는 묻되 반드시 확인한다.
환각과 자주 헷갈리는 것이 편향이다. 둘 다 "검증 단계가 파이프라인에 없다"는 같은 구조에서 나오지만, 환각은 없는 사실을 지어내는 것이고 편향은 실제 데이터의 통계적 쏠림을 그대로 반영하는 것이라 원인과 대응법이 다르다.
※ 본 글은 2026년 7월 기준 정보이며 투자 권유가 아닙니다. AI 도구로 얻은 정보를 투자 판단에 사용할 경우 반드시 원문 공시·거래소 데이터 등 1차 자료로 검증하시기 바랍니다. 투자 판단과 책임은 투자자 본인에게 있습니다.
※ 본 가이드는 일반 교육 목적의 참고 자료이며, 이해를 돕기 위해 기술적 세부사항을 단순화했습니다.
새 가이드가 나오면 알려드립니다
AI 리터러시 가이드는 주 2회 발행합니다. 구독하시면 다음 편을 메일로 보내드립니다. 무료이고 언제든 해지할 수 있습니다.
