기초 이론 편 · 4부 AI는 어떻게 자료를 읽고 도구를 쓸까? — 4.4
에이전트 — AI가 스스로 일을 끝내는 법
도구 호출을 여러 번 이어서 스스로 일을 끝내는 게 에이전트입니다. 그 판단만 빠르게 하려는 새 모델도 나왔습니다.
앞 장의 날씨 질문은 도구를 한 번 부르고 끝났습니다. 그런데 “회의 자료 찾아서 요약해서 팀장님께 메일로 보내줘” 같은 일은 한 번으로 안 끝납니다. 찾고, 열고, 요약하고, 보내야 하죠.
에이전트(agent) 는 이걸 스스로 이어갑니다. 상황을 보고 → 다음 행동을 고르고 → 도구로 실행하고 → 결과를 보고 → 또 다음 행동을 고르고… 목표를 이룰 때까지 이 고리(loop) 를 반복합니다. 코딩 도우미가 코드를 고치고, 테스트를 돌려보고, 실패하면 다시 고치는 것도 같은 고리입니다.
목표: "회의 자료 찾아서 요약해서 팀장님께 메일로 보내줘". "다음"을 눌러 진행하고, 두 방식을 바꿔가며 보세요.
지금 상황
모델이 쓴 글
고른 결과 (선택지마다 확률)
행동과 확률은 설명을 위해 직접 정한 예시예요.
에이전트의 핵심은 “다음에 뭘 할까”
위젯을 진행해보면, 에이전트가 매 단계 하는 일은 결국 “다음 행동 고르기” 입니다. 지금까지는 이 고르기도 LLM이 했습니다. 4.3처럼 도구를 부르는 글을 쓰는 방식으로요.
그런데 이 방식에는 아쉬운 점이 있습니다.
- 느리고 비쌉니다. 행동 하나를 고르는데 글을 한 토큰씩 써야 합니다. 에이전트는 이런 고르기를 수십, 수백 번 합니다.
- 얼마나 확신하는지 모르기 쉽습니다. “글을 쓰는 모델” 쪽 2단계를 보세요. 9월 회의록일 수도 있는데, 모델이 쓴 글에는 그냥 “10월 거 열기”만 있습니다. 헷갈렸는지 아닌지가 드러나지 않습니다.
“선택지를 고르는 모델” 쪽으로 바꿔서 같은 2단계를 보세요. 선택지마다 확률이 나오니까, 프로그램이 “확신이 낮으면 사람에게 물어보기” 같은 규칙을 세울 수 있습니다.
고르기만 하는 모델: Jev
2026년 9월, 미국 스타트업 TypeSafe AI가 정확히 이 아이디어로 만든 모델 Jev를 공개했습니다. Jev는 글을 쓰지 않습니다. 상황(글이나 데이터)과 질문을 받으면, 미리 정해 둔 형태로 답을 돌려줍니다.
- 선택: 정해진 선택지 중 하나와 각각의 확률 (위젯의 “선택지를 고르는 모델”처럼)
- 점수: 정해진 단계 중 어디쯤인지
- 예/아니오: 맞을 확률
LLM처럼 한 토큰씩 이어 쓰지 않고 여러 질문에 한 번에 답해서, 회사는 큰 LLM보다 수십~수백 배 빠르고 싸다고 주장합니다. 회사는 이걸 LLM을 대신하는 게 아니라, 빠른 판단만 맡는 보조 층이라고 설명합니다. 생각하고 글을 쓰는 건 LLM이, 매 순간 빠르게 고르는 건 Jev가 하는 식으로요.
이 방향은 1.2에서 본 분류(정해진 선택지 중 고르기)로 돌아간 셈입니다. 오래된 머신러닝 문제가, 에이전트 시대에 다시 중요해진 것입니다.
더 깊게 · '보정된 확률'이 무슨 뜻일까
Jev는 “보정된(calibrated) 확률”을 내세웁니다. 보정됐다는 건, 모델이 70%라고 말한 것들을 모아보면 실제로 70% 정도가 맞는다는 뜻입니다. 90%라고 한 것들은 90% 정도 맞고요.
이게 왜 중요할까요? 확률이 보정돼 있어야 위젯처럼 “60% 미만이면 사람에게 확인” 같은 규칙이 의미가 있습니다. 모델이 맨날 99%라고 하면서 실제론 자주 틀린다면, 그 숫자는 믿을 수 없으니까요.
다만 보정은 여러 답을 모아서 본 성질입니다. “90%라고 했으니 이번 답은 확실하다”는 보장은 아닙니다. 열 번 중 한 번은 틀린다는 뜻이니까요. 6부 환각 장에서 “모르면 모른다고 하기”와 함께 다시 나옵니다.
정리
- 에이전트는 상황 보기 → 행동 고르기 → 도구 실행 → 결과 보기를 목표를 이룰 때까지 반복합니다.
- 행동 고르기를 LLM이 글로 하면 느리고, 얼마나 확신하는지 드러나지 않기 쉽습니다.
- Jev 같은 모델은 글 대신 선택지와 확률을 바로 돌려줍니다. 빠른 판단만 맡는 보조 층입니다.
이 장을 복사합니다. ChatGPT나 Claude 같은 AI에 붙여넣고 그대로 보내면 AI가 다 읽었다고 답합니다. 그다음 궁금한 걸 물어보세요.