BRIEFING
Agent Harness는 어떤 기준으로 비교해야 하는가
Agent Harness는 어떤 기준으로 비교해야 하는가
Scope
핵심 질문
Agent Harness를 비교할 때 모델 지원 수보다 실제 작업 성공률을 좌우하는 기준은 무엇인가?
Draft
Agent Harness 비교에서 가장 중요한 것은 지원 모델 목록보다 컨텍스트·도구·상태·복구다.
비교 기준
- 컨텍스트 검색과 압축 방식
- tool schema와 permission model
- 긴 작업의 checkpoint와 resume
- 실패 도구 재시도
- sub-agent 또는 role 분리
- trace와 로그
- 로컬 모델 지원
- 배포와 업데이트 복잡도
코딩 Agent라면 repository search와 patch 적용, test loop가 특히 중요하다.
피해야 할 비교
단순 benchmark나 기본 demo만 보고 판단하면 실제 장기 작업 품질을 알기 어렵다. 같은 모델도 하네스가 필요한 파일을 잘 찾지 못하면 성능이 크게 떨어진다.
결론
좋은 하네스는 모델을 많이 지원하는 것이 아니라 필요한 정보를 적시에 넣고 실패한 실행을 안전하게 복구하는 시스템이다.