brief.ing.gg

WIKI

AI Agent

AI Agent

도구 호출과 상태를 이용해 여러 단계를 수행하는 AI Agent는 어떻게 구성되는가.

Scope

핵심 질문

AI Agent는 일반적인 챗봇과 무엇이 다르며, 여러 단계의 작업을 수행하려면 어떤 구성요소가 필요한가?

포함 범위

  • 모델, 도구, 상태, 실행 루프
  • 계획과 실행
  • 실패·재시도·중단
  • 메모리와 컨텍스트
  • 자율성의 범위와 위험

제외 범위

  • 특정 Agent 제품의 최신 기능 비교
  • 완전자율 AGI에 대한 전망

Research

핵심 근거

  • Agent 시스템은 LLM 단독이 아니라 모델, 도구 호출, 상태 관리, 실행 루프를 결합한 애플리케이션 구조로 이해하는 편이 정확하다.
  • 대표적 패턴은 관찰 → 판단 → 행동 → 결과 관찰의 반복이다.
  • 작업이 길어질수록 모델 성능뿐 아니라 상태 보존, 도구 실패 처리, 중복 행동 방지, 종료조건이 중요해진다.
  • ReAct 계열 연구는 reasoning과 action을 번갈아 수행하는 패턴을 명시적으로 제시했다.

참고 자료

  • Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models: https://arxiv.org/abs/2210.03629
  • Schick et al., Toolformer: https://arxiv.org/abs/2302.04761

Draft

AI Agent는 언어 모델이 단순히 답변을 생성하는 데서 끝나지 않고, 외부 도구를 사용하고 상태를 갱신하면서 여러 단계의 목표를 수행하도록 만든 시스템이다.

챗봇과 Agent의 차이

일반적인 챗봇은 사용자의 입력을 받고 텍스트를 반환하면 한 번의 상호작용이 끝난다.

Agent는 목표를 받은 뒤 필요한 정보를 찾고, 도구를 호출하고, 결과를 해석하고, 다음 행동을 정하는 과정을 반복할 수 있다. 예를 들어 지난달 영수증을 찾아 지출을 분류하라는 요청이라면 메일 검색, 첨부파일 읽기, 분류, 계산, 결과 작성이 여러 단계로 이어진다.

기본 구성요소

Agent에는 보통 다음 요소가 필요하다.

  1. 모델: 다음 행동이나 답변을 결정한다.
  2. 도구: 검색, 코드 실행, 파일 읽기, API 호출 등 모델 밖의 행동을 수행한다.
  3. 상태: 지금까지 무엇을 했고 어떤 결과를 얻었는지 보존한다.
  4. 실행 루프: 모델의 결정과 도구 결과를 반복적으로 연결한다.
  5. 종료조건: 목표가 완료됐는지, 더 진행하면 안 되는지 판단한다.

계획과 실행

복잡한 작업에서는 모든 행동을 처음부터 완벽하게 계획하기 어렵다. 그래서 실제 Agent는 계획 → 한 단계 실행 → 결과 확인 → 계획 수정 식으로 동작하는 경우가 많다.

ReAct 패턴은 reasoning과 action을 번갈아 수행하는 대표적인 접근이다. 중요한 것은 장문의 계획 자체보다 실제 도구 결과를 다음 판단에 반영하는 것이다.

상태와 메모리

작업이 길어지면 모든 과거 내용을 모델 컨텍스트에 계속 넣을 수 없다. 그래서 단기 상태, 요약, 외부 메모리, 검색 가능한 기록을 구분할 필요가 있다.

Agent의 품질은 모델 크기뿐 아니라 어떤 상태를 보존하고 어떤 정보를 버리는지에 크게 좌우된다.

실패가 기본 상태다

도구 호출은 실패할 수 있다. 네트워크 요청은 시간초과가 날 수 있고, 웹페이지 구조는 바뀔 수 있으며, 같은 작업을 두 번 실행하면 문제가 생길 수 있다.

따라서 실제 Agent 시스템에는 재시도 횟수, idempotency, timeout, 사용자 확인, rollback 가능성, 최대 실행단계 같은 운영 규칙이 필요하다.

자율성은 많을수록 좋은가

항상 그렇지는 않다. 읽기 작업은 비교적 자유롭게 자동화할 수 있지만 결제, 삭제, 외부 메시지 전송처럼 되돌리기 어려운 행동은 사람이 확인하는 편이 안전하다.

메일·웹페이지·첨부파일·도구 결과는 모델에 다시 보이더라도 사용자 지시나 권한 부여가 아닌 비신뢰 데이터로 취급한다. 그 안의 요청이 도구 권한을 늘리거나 승인 절차를 건너뛰지 못하도록 실행환경에서 검사하고, 되돌리기 어려운 행동은 실제 사용자의 명시적 승인을 받는다. 좋은 Agent는 가장 자율적인 시스템이 아니라 작업 위험도에 맞게 자율성과 확인 단계를 조절한 시스템이다.

핵심

AI Agent는 LLM에 도구와 상태관리, 실행 루프를 결합해 목표 지향적인 여러 단계 작업을 수행하는 시스템이다. 장기 작업에서는 모델의 지능만큼 상태관리, 오류처리, 종료조건과 권한 설계가 중요하다.