기초 이론 편 · 1부 AI가 도대체 뭔데? — 1.2
AI는 왜 규칙 대신 예시로 배울까
스팸 필터를 규칙으로 직접 만들어 보면, 머신러닝이 왜 필요한지 바로 보입니다.
스팸 문자를 걸러내는 프로그램을 만든다고 해볼까요? 가장 먼저 떠오르는 방법은 아마 이런 것입니다.
“광고”라는 단어가 있으면 스팸, “무료”가 있으면 스팸, 링크가 있으면 스팸…
이렇게 사람이 규칙을 직접 정하는 방법입니다. 아래에서 직접 해보세요.
조건을 눌러서 켜고 꺼보세요. 하나라도 맞으면 스팸으로 봅니다. 12개 중 몇 개까지 맞힐 수 있을까요?
6 / 12 맞힘
- [광고] 오늘만 무료 체험! 지금 가입하세요 http://…
- 이번 주말 전시 무료래! 같이 갈래?
- 축하합니다!! 경품에 당첨되셨습니다 http://…
- 회의 자료 링크예요 http://…
- 고객님 택배가 보관 중입니다. 주소 확인 http://…
- 택배 잘 받았어 고마워!!
- 엄마 나 폰 고장나서 이 번호로 연락해
- 엄마 오늘 좀 늦어. 저녁 먼저 먹어
- 무료 상품권 받아가세요!!
- 나 회사 경품 추첨 당첨됐어!! 대박
- (광고) 단독 특가 70% 할인 · 수신거부 080
- 내일 점심 뭐 먹을까
해보면 생기는 일
어떻게 조합해도 12개를 전부 맞히지는 못합니다. 이유는 두 가지입니다.
정상 문자도 같은 단어를 씁니다. 친구가 “전시 무료래!”라고 보내면 ‘무료’ 규칙에 걸립니다. 진짜로 경품에 당첨된 친구의 “당첨됐어!!”도 마찬가지입니다.
스팸이 그 단어를 안 쓸 수도 있습니다. “엄마 나 폰 고장나서 이 번호로 연락해”는 가족을 사칭하는 스팸이지만, 광고도 무료도 링크도 없습니다. 바로 아래 “엄마 오늘 좀 늦어”와 단어만 봐서는 구별하기 어렵습니다.
그럼 규칙을 더 추가하면 될까요? “‘엄마’와 ‘번호’가 같이 나오면 스팸” 같은 규칙을 계속 덧붙이면, 이 12개는 결국 다 맞힐 수도 있습니다. 하지만 내일 새로운 수법의 스팸이 오면 또 새 규칙이 필요하고, 그 규칙이 다른 정상 문자를 막을 수도 있습니다. 예외가 끝없이 생기고, 사람이 그걸 다 미리 생각할 수는 없습니다.
예시로 배우게 하기
머신러닝은 방향을 뒤집습니다. 사람이 규칙을 쓰는 대신, 이렇게 합니다.
- “이건 스팸”, “이건 정상”처럼 정답이 붙은 예시를 아주 많이 모읍니다.
- 컴퓨터에게 보여주고, 어떤 단서가 얼마나 스팸 쪽인지를 스스로 정하게 합니다.
- 틀리면 조금 고치고, 다시 보여주고, 또 고치는 걸 반복합니다.
그러면 컴퓨터는 “‘무료’는 스팸 쪽으로 조금, 처음 보는 번호에서 온 ‘이 번호로 연락해’는 스팸 쪽으로 많이”처럼, 단서마다 숫자 하나씩을 정하게 됩니다. 사람은 이 숫자를 직접 정하지 않고, 예시만 준비합니다.
이 “단서마다 붙은 숫자”를 가중치라고 부릅니다. 2부에서 이 숫자를 직접 움직여 보겠습니다.
| 규칙을 짜는 방법 | 예시로 배우는 방법 | |
|---|---|---|
| 누가 판단 기준을 정하나 | 사람 | 컴퓨터 (사람은 예시를 준비) |
| 필요한 것 | 규칙을 아는 사람 | 정답이 붙은 예시 많이 |
| 새로운 유형이 나오면 | 사람이 규칙을 새로 써야 함 | 새 예시를 넣고 다시 배우게 함 |
| 왜 그렇게 판단했는지 | 규칙을 보면 바로 알 수 있음 | 설명하기 어려울 때가 많음 |
더 깊게 · 그럼 ChatGPT의 규칙은 누가 썼을까
아무도 문법 규칙을 하나하나 써 주지 않았습니다. LLM도 이 장과 같은 방식으로, 엄청난 양의 글이라는 예시에서 배웠습니다. “이 다음에는 어떤 말이 올까”를 맞히는 연습을 아주 많이 하면서, 그 과정에서 문법이나 말투 같은 것도 함께 익힌 것입니다. 이게 무슨 뜻인지는 3부에서 자세히 보겠습니다.
정리
- 규칙을 직접 짜면, 예외가 끝없이 생깁니다.
- 머신러닝은 규칙 대신 정답이 붙은 예시를 주고, 판단 기준은 컴퓨터가 정하게 합니다.
- 컴퓨터가 정하는 그 기준은 결국 숫자(가중치) 들입니다.
다음 부에서는 그 숫자가 실제로 무엇이고, 컴퓨터가 어떻게 그 숫자를 “배우는지” 보겠습니다.
이 장을 복사합니다. ChatGPT나 Claude 같은 AI에 붙여넣고 그대로 보내면 AI가 다 읽었다고 답합니다. 그다음 궁금한 걸 물어보세요.