brief.ing.gg

BRIEFING

Agent Harness는 어떤 기준으로 비교해야 하는가

Agent Harness는 어떤 기준으로 비교해야 하는가

Scope

핵심 질문

Agent Harness를 비교할 때 모델 지원 수보다 실제 작업 성공률을 좌우하는 기준은 무엇인가?

Draft

Agent Harness 비교에서 가장 중요한 것은 지원 모델 목록보다 컨텍스트·도구·상태·복구다.

비교 기준

  • 컨텍스트 검색과 압축 방식
  • tool schema와 permission model
  • 긴 작업의 checkpoint와 resume
  • 실패 도구 재시도
  • sub-agent 또는 role 분리
  • trace와 로그
  • 로컬 모델 지원
  • 배포와 업데이트 복잡도

코딩 Agent라면 repository search와 patch 적용, test loop가 특히 중요하다.

피해야 할 비교

단순 benchmark나 기본 demo만 보고 판단하면 실제 장기 작업 품질을 알기 어렵다. 같은 모델도 하네스가 필요한 파일을 잘 찾지 못하면 성능이 크게 떨어진다.

결론

좋은 하네스는 모델을 많이 지원하는 것이 아니라 필요한 정보를 적시에 넣고 실패한 실행을 안전하게 복구하는 시스템이다.