기초 이론 편 · 6부 AI는 왜 틀리고, 치우치고, 속을까? — 6.4
AI 점수는 믿을 만할까, 전기는 얼마나 들까
AI의 시험 점수는 생각보다 믿기 어렵고, AI를 만들고 돌리는 데는 엄청난 전기가 듭니다.
새 AI 모델이 나오면 늘 ”○○ 시험에서 최고 점수”라는 발표가 따라옵니다. 이런 시험을 벤치마크(benchmark) 라고 합니다. 그런데 이 점수를 그대로 믿어도 될까요?
문제 1: 시험 문제를 미리 봤을 수도 있습니다
두 모델의 공개 시험 점수예요. 어느 쪽이 더 좋아 보이나요? 그다음 새로 만든 문제로 다시 시험해보세요.
모델 A
모델 B
점수는 설명을 위해 만든 예시예요.
2.5에서 연습 문제 점수만 보면 안 되고, 처음 보는 문제로 따로 시험해야 한다고 했습니다. 그런데 유명한 벤치마크 문제들은 대부분 인터넷에 공개돼 있습니다. LLM은 인터넷 글로 학습하니까, 학습 데이터에 시험 문제와 답이 섞여 들어갈 수 있습니다. 그러면 높은 점수가 실력이 아니라 외운 결과일 수 있습니다. 이걸 오염(contamination) 이라고 부릅니다. 일부러 그런 게 아니어도 생길 수 있어서 더 까다롭습니다.
문제 2: 시험이 너무 쉬워집니다
좋은 시험은 잘하는 모델과 아주 잘하는 모델을 구별해줘야 합니다. 그런데 모델들이 빠르게 좋아지면서, 몇 년 전에 어렵다고 만든 시험에서 최고 모델들이 거의 만점을 받게 됐습니다. 다들 95점이면 그 시험으로는 누가 더 나은지 알 수 없습니다. 이걸 포화(saturation) 라고 합니다. 그래서 더 어려운 시험을 계속 새로 만듭니다.
문제 3: 점수 자체가 목표가 되면
6.1에서 본 것처럼, 맞힌 비율만 보는 시험은 “모르면 찍기”를 부추길 수 있습니다. 점수를 올리는 게 목표가 되면, 점수는 오르는데 실제로 쓸 때는 별로 나아지지 않는 일이 생깁니다. 점수는 참고 자료이지 그 자체가 “똑똑함”은 아닙니다.
그럼 어떻게 판단할까? 결국 내가 실제로 쓸 일로 직접 시험해보는 것이 가장 정확합니다. 내 업무, 내 질문 몇 개를 정해두고 여러 모델에 똑같이 물어보세요. 공개 순위표보다 그게 나에게 더 쓸모 있는 점수입니다.
비용: 계산에는 전기가 듭니다
지금까지 본 모든 것, 즉 수천억 개 가중치로 하는 학습(2부)과, 토큰 하나 만들 때마다 가중치를 거의 다 쓰는 계산(5.1)은 전부 데이터센터의 그래픽카드에서 돌아갑니다. 그리고 거기엔 전기가 듭니다.
- 학습: 큰 모델 하나를 사전학습하는 데 아주 많은 그래픽카드가 오랜 기간 쉬지 않고 돌아갑니다.
- 사용: 학습은 한 번이지만, 사용은 전 세계 사람들이 매일 합니다. 질문 하나하나는 작아도, 모이면 큽니다.
효율은 계속 좋아지고 있어요(5부의 양자화, 작은 모델, 전문가 혼합 같은 방법들). 하지만 쓰는 양이 더 빠르게 늘어서, 전체 전기 사용량은 늘고 있습니다.
더 깊게 · 이 자료를 마치며
여기까지 오셨다면, ChatGPT나 Claude 안에서 무슨 일이 일어나는지 큰 그림은 다 본 것입니다.
- 예시에서 배우고(1부), 틀린 만큼 가중치를 고치고(2부),
- 글을 토큰으로 잘라 다음 토큰을 맞히고(3부),
- 컨텍스트에 자료와 도구를 넣어 일을 시키고(4부),
- 그걸 돌리려면 메모리와 전기가 많이 들고(5부, 6부),
- 그래서 틀리고, 치우치고, 속을 수 있다는 것(6부)까지.
다음에 AI가 이상한 답을 하면, “어떤 단계에서 이런 일이 생겼을까?”를 한번 떠올려보세요. 이 자료가 그 질문을 할 수 있게 도와줬다면 충분합니다.
정리
- 벤치마크 점수는 오염(문제를 미리 봄)과 포화(너무 쉬워짐) 때문에 그대로 믿기 어렵습니다.
- 가장 쓸모 있는 평가는 내가 실제로 쓸 일로 직접 시험해보는 것입니다.
- AI를 학습시키고 쓰는 데는 많은 전기가 들고, 효율이 좋아지는 것보다 사용량이 더 빨리 늘고 있습니다.
이 장을 복사합니다. ChatGPT나 Claude 같은 AI에 붙여넣고 그대로 보내면 AI가 다 읽었다고 답합니다. 그다음 궁금한 걸 물어보세요.