AI 바로 알기 편 · 4부 모든 곳에 AI가 필요할까? — 4.2
LLM이 꼭 필요할까? 더 단순한 방법으로 충분한 경우
규칙, 공식, 표 데이터용 머신러닝으로 충분한 문제에 LLM을 붙이면, 더 느리고 비싸고 덜 정확해질 수 있습니다.
ChatGPT가 워낙 유명해지다 보니, 무슨 문제든 “LLM을 붙이면 되지 않을까?”라는 생각이 들기 쉽습니다. 실제로 온갖 서비스에 LLM API를 연결하거나, 큰 오픈소스 모델을 가져다 붙이는 일이 많아졌습니다. 그런데 많은 문제는 훨씬 단순한 방법으로 더 잘 풀립니다.
각 문제에 어떤 방법이 어울릴지 골라보세요.
-
월급에서 세금과 보험료 계산하기
-
과거 판매 기록 표로 내일 손님 수 예측하기
-
스팸 문자 걸러내기
-
고객 문의 메일 수백 통을 읽고 요약하기
-
재고가 10개 아래로 떨어지면 알림 보내기
-
회의 녹음을 받아 적고 할 일 목록 뽑기
보통의 선택을 보여주는 예시입니다. 실제로는 여러 방법을 섞어 쓰기도 합니다.
왜 단순한 방법이 나을 때가 있을까
| 규칙·공식 | 표 데이터용 머신러닝 | LLM | |
|---|---|---|---|
| 정확도 | 규칙이 맞으면 항상 정확 | 예측 문제에 강함 | 글·말에 강함, 계산·숫자는 약함 |
| 속도와 비용 | 거의 공짜, 즉시 | 빠르고 쌈 | 상대적으로 느리고 비쌈 |
| 같은 입력에 같은 답 | 항상 | 항상 | 아닐 수 있음 |
| 왜 그렇게 했는지 설명 | 쉬움 | 어느 정도 가능 | 어려움 |
LLM을 붙이면 “AI를 썼다”는 인상은 생기지만, 이 표처럼 느려지고, 비싸지고, 같은 질문에 다른 답이 나오고, 이유를 설명하기 어려워지는 대가를 치를 수 있습니다. 세금 계산처럼 틀리면 안 되는 일에서는 특히 문제입니다.
표 데이터에서는 오래된 방법이 여전히 강합니다
엑셀처럼 칸이 나뉜 표 데이터(매출, 고객 정보, 센서 기록 등)는 회사에서 가장 흔한 데이터입니다. 2022년 NeurIPS 학회에 발표된 연구는 여러 표 데이터셋에서 비교했을 때, 중간 크기(약 1만 개 정도)의 데이터에서는 XGBoost나 랜덤 포레스트 같은 트리 기반 모델이 딥러닝보다 여전히 더 좋은 결과를 낸다고 보고했습니다. 속도까지 따지면 차이는 더 큽니다.
새로운 게 항상 더 좋은 건 아닙니다. 문제에 맞는 도구를 고르는 게 실력입니다.
더 깊게 · XGBoost가 뭐예요?
XGBoost는 “결정 트리”를 여러 개 이어 붙이는 방식의 머신러닝 도구입니다. 결정 트리는 “온도가 25도보다 높은가? → 주말인가? → …”처럼 질문을 따라 내려가며 답을 정하는 구조입니다. 트리 하나는 단순하지만, 앞 트리가 틀린 부분을 다음 트리가 고치도록 수백 개를 쌓으면 표 데이터에서 매우 정확해집니다. 기초 이론 편 2.2의 “틀린 걸 보고 고치기”와 같은 생각입니다.
참고: Grinsztajn 외, “Why do tree-based models still outperform deep learning on typical tabular data?”, NeurIPS 2022.
정리
- 많은 문제는 규칙, 공식, 표 데이터용 머신러닝으로 더 잘 풀립니다.
- 필요 없는 곳에 LLM을 붙이면 느리고, 비싸고, 답이 흔들리고, 설명하기 어려워질 수 있습니다.
- 표 데이터에서는 트리 기반 모델이 여전히 강하다는 연구가 있습니다. 문제에 맞는 도구를 고르세요.
이 장을 복사합니다. ChatGPT나 Claude 같은 AI에 붙여넣고 그대로 보내면 AI가 다 읽었다고 답합니다. 그다음 궁금한 걸 물어보세요.