Project NEUROVERSE
목차

AI 바로 알기 편 · 4부 모든 곳에 AI가 필요할까? — 4.2

LLM이 꼭 필요할까? 더 단순한 방법으로 충분한 경우

규칙, 공식, 표 데이터용 머신러닝으로 충분한 문제에 LLM을 붙이면, 더 느리고 비싸고 덜 정확해질 수 있습니다.

ChatGPT가 워낙 유명해지다 보니, 무슨 문제든 “LLM을 붙이면 되지 않을까?”라는 생각이 들기 쉽습니다. 실제로 온갖 서비스에 LLM API를 연결하거나, 큰 오픈소스 모델을 가져다 붙이는 일이 많아졌습니다. 그런데 많은 문제는 훨씬 단순한 방법으로 더 잘 풀립니다.

각 문제에 어떤 방법이 어울릴지 골라보세요.

  1. 월급에서 세금과 보험료 계산하기

  2. 과거 판매 기록 표로 내일 손님 수 예측하기

  3. 스팸 문자 걸러내기

  4. 고객 문의 메일 수백 통을 읽고 요약하기

  5. 재고가 10개 아래로 떨어지면 알림 보내기

  6. 회의 녹음을 받아 적고 할 일 목록 뽑기

보통의 선택을 보여주는 예시입니다. 실제로는 여러 방법을 섞어 쓰기도 합니다.

왜 단순한 방법이 나을 때가 있을까

규칙·공식표 데이터용 머신러닝LLM
정확도규칙이 맞으면 항상 정확예측 문제에 강함글·말에 강함, 계산·숫자는 약함
속도와 비용거의 공짜, 즉시빠르고 쌈상대적으로 느리고 비쌈
같은 입력에 같은 답항상항상아닐 수 있음
왜 그렇게 했는지 설명쉬움어느 정도 가능어려움

LLM을 붙이면 “AI를 썼다”는 인상은 생기지만, 이 표처럼 느려지고, 비싸지고, 같은 질문에 다른 답이 나오고, 이유를 설명하기 어려워지는 대가를 치를 수 있습니다. 세금 계산처럼 틀리면 안 되는 일에서는 특히 문제입니다.

표 데이터에서는 오래된 방법이 여전히 강합니다

엑셀처럼 칸이 나뉜 표 데이터(매출, 고객 정보, 센서 기록 등)는 회사에서 가장 흔한 데이터입니다. 2022년 NeurIPS 학회에 발표된 연구는 여러 표 데이터셋에서 비교했을 때, 중간 크기(약 1만 개 정도)의 데이터에서는 XGBoost나 랜덤 포레스트 같은 트리 기반 모델이 딥러닝보다 여전히 더 좋은 결과를 낸다고 보고했습니다. 속도까지 따지면 차이는 더 큽니다.

새로운 게 항상 더 좋은 건 아닙니다. 문제에 맞는 도구를 고르는 게 실력입니다.

더 깊게 · XGBoost가 뭐예요?

XGBoost는 “결정 트리”를 여러 개 이어 붙이는 방식의 머신러닝 도구입니다. 결정 트리는 “온도가 25도보다 높은가? → 주말인가? → …”처럼 질문을 따라 내려가며 답을 정하는 구조입니다. 트리 하나는 단순하지만, 앞 트리가 틀린 부분을 다음 트리가 고치도록 수백 개를 쌓으면 표 데이터에서 매우 정확해집니다. 기초 이론 편 2.2의 “틀린 걸 보고 고치기”와 같은 생각입니다.

참고: Grinsztajn 외, “Why do tree-based models still outperform deep learning on typical tabular data?”, NeurIPS 2022.

정리

  • 많은 문제는 규칙, 공식, 표 데이터용 머신러닝으로 더 잘 풀립니다.
  • 필요 없는 곳에 LLM을 붙이면 느리고, 비싸고, 답이 흔들리고, 설명하기 어려워질 수 있습니다.
  • 표 데이터에서는 트리 기반 모델이 여전히 강하다는 연구가 있습니다. 문제에 맞는 도구를 고르세요.

이 장을 복사합니다. ChatGPT나 Claude 같은 AI에 붙여넣고 그대로 보내면 AI가 다 읽었다고 답합니다. 그다음 궁금한 걸 물어보세요.