brief.ing.gg

WIKI

웹 아카이빙

웹 아카이빙

웹페이지를 장기 보존하기 위해 원문·스크린샷·메타데이터를 저장하는 방식은 무엇인가.

Scope

핵심 질문

웹 아카이빙은 한 시점의 웹 콘텐츠를 어떤 형식과 수준으로 보존하는가?

Research

핵심 근거

  • 단순 HTML 저장, screenshot, PDF, WARC, 브라우저 기반 full-page archive는 보존 수준이 다르다.
  • JavaScript와 외부 resource가 많은 현대 웹은 HTML 한 파일만 저장해서는 재현되지 않을 수 있다.
  • ArchiveBox 등은 여러 capture method를 조합한다.

참고 자료

  • https://docs.archivebox.io/latest/

Draft

웹 아카이빙은 특정 시점의 웹페이지를 나중에도 확인할 수 있도록 콘텐츠와 관련 자원을 보존하는 작업이다.

저장 수준

가장 가벼운 방법은 HTML만 저장하는 것이다. 하지만 image, CSS, script가 외부 URL에 있으면 나중에 페이지가 깨질 수 있다.

Screenshot은 시각적 증거는 잘 남지만 텍스트 검색과 link navigation이 어렵다. PDF도 읽기에는 편하지만 interactive state를 보존하지 못한다.

Full-page Archive

Single-file HTML이나 browser capture는 resource를 함께 묶어 보존성을 높일 수 있다.

대규모 보존에서는 WARC처럼 HTTP response를 기록하는 표준 포맷도 사용된다.

현대 웹의 어려움

로그인, infinite scroll, client-side rendering, video stream은 단순 crawler로 완전히 보존하기 어렵다.

핵심

웹 아카이빙은 하나의 파일포맷 문제가 아니라 무엇을 재현하고 싶은지에 따라 capture 전략을 고르는 문제다.