기초 이론 편 · 6부 AI는 왜 틀리고, 치우치고, 속을까? — 6.1
환각 — 왜 모르면서 아는 척할까
모델은 그럴듯한 다음 말을 만드는 기계이고, 채점 방식이 '찍기'를 부추기기도 합니다.
AI가 없는 책 제목을 지어내거나, 틀린 날짜를 아주 자신 있게 말하는 걸 본 적 있나요? 이렇게 그럴듯하지만 사실이 아닌 답을 환각(hallucination) 이라고 합니다. 4.2에서 자료 없이 빵집 영업시간을 물었을 때 나온 답도 환각이었습니다.
왜 이런 일이 생길까요? 두 가지 이유가 있습니다.
이유 1: 모델은 “그럴듯한 다음 말”을 만드는 기계입니다
3.1에서 본 대로, 모델은 다음에 올 그럴듯한 말을 고릅니다. “맞는” 말이 아니라 “그럴듯한” 말이요. 대부분은 그럴듯한 말이 맞는 말이라서 문제가 없습니다. 그런데 모델이 잘 모르는 내용에서는, 그럴듯한 모양(날짜처럼 생긴 숫자, 책 제목처럼 생긴 문장)만 만들어지고 내용은 틀릴 수 있습니다.
“모르겠습니다”라고 말하는 것도 결국 다음 말 중 하나라서, 그 말을 고르도록 따로 배워야 합니다. 그리고 여기서 두 번째 이유가 나옵니다.
이유 2: 채점 방식이 “찍기”를 부추깁니다
4지선다 10문제 시험이에요. 두 모델 모두 6문제는 확실히 알고, 4문제는 몰라요. 채점 방식을 바꿔가며 시험을 쳐보세요.
정직한 모델 모르면 "모르겠어요"
이번 점수 – · 평균
찍는 모델 모르면 아무거나 골라서 자신 있게
이번 점수 – · 평균
시험에서 모르는 4지선다 문제가 나오면 어떻게 하세요? 틀려도 감점이 없다면, 빈칸으로 두는 것보다 찍는 게 이득입니다. 4분의 1 확률로 맞으니까요.
AI 모델도 비슷합니다. 모델을 평가하는 시험(벤치마크) 중 많은 것들이 맞힌 비율만 봅니다. 그러면 “모르겠습니다”는 0점이고, 찍으면 가끔 맞아서 점수가 올라갑니다. 점수가 높은 모델을 좋은 모델로 보고 그쪽으로 개발하다 보면, 모를 때도 자신 있게 답하는 쪽으로 기울게 됩니다.
OpenAI 연구진은 2025년 9월 논문 “Why Language Models Hallucinate”에서 바로 이 점을 지적했습니다. 학습과 평가 방식이 불확실할 때 인정하기보다 추측하는 쪽에 보상을 준다는 것입니다. 그래서 틀린 답에 감점을 주는 식으로 평가 방식 자체를 바꿔야 한다고 제안했습니다.
쓰는 사람이 할 수 있는 것
- 중요한 사실은 확인하기: 숫자, 날짜, 인용, 법률, 의료 정보는 원래 출처를 직접 확인하세요.
- 자료를 넣어주기: 4.2의 RAG처럼 관련 자료를 같이 주면 지어낼 여지가 줄어듭니다.
- 출처를 요구하기: 출처를 달라고 하고, 그 출처가 실제로 있는지 열어보세요. 출처 자체를 지어내는 경우도 있습니다.
- 모르면 모른다고 해도 된다고 말해주기: “확실하지 않으면 모른다고 해줘”라고 요청하면 도움이 되는 경우가 있습니다.
더 깊게 · 자신감과 정확도: 보정
4.4에서 본 보정을 떠올려보세요. 잘 보정된 모델이라면 “90% 확신”이라고 한 답들은 실제로 90% 정도 맞아야 합니다. 환각은 이게 어긋난 상태, 즉 확신은 높은데 실제로는 틀린 상태입니다.
LLM은 다음 토큰마다 확률을 내지만, 그게 “이 답이 사실일 확률”과 같은 건 아닙니다. “1987년”이라는 토큰의 확률이 높다는 건 “이 자리에 그 토큰이 그럴듯하다”는 뜻이지, “사실일 확률이 높다”는 보장이 아니거든요. 그래서 모델의 말투나 토큰 확률만으로 환각을 걸러내기는 어렵고, 이걸 잘 해내는 방법은 지금도 연구되고 있습니다.
정리
- 환각은 그럴듯하지만 사실이 아닌 답입니다.
- 모델은 “맞는 말”이 아니라 “그럴듯한 말”을 만들고, 맞힌 비율만 보는 채점은 찍기를 부추깁니다.
- 중요한 정보는 출처를 확인하고, 자료를 함께 넣어주세요.
이 장을 복사합니다. ChatGPT나 Claude 같은 AI에 붙여넣고 그대로 보내면 AI가 다 읽었다고 답합니다. 그다음 궁금한 걸 물어보세요.