WIKI
웹 아카이빙
웹 아카이빙
웹페이지를 장기 보존하기 위해 원문·스크린샷·메타데이터를 저장하는 방식은 무엇인가.
Scope
핵심 질문
웹 아카이빙은 한 시점의 웹 콘텐츠를 어떤 형식과 수준으로 보존하는가?
Research
핵심 근거
- 단순 HTML 저장, screenshot, PDF, WARC, 브라우저 기반 full-page archive는 보존 수준이 다르다.
- JavaScript와 외부 resource가 많은 현대 웹은 HTML 한 파일만 저장해서는 재현되지 않을 수 있다.
- ArchiveBox 등은 여러 capture method를 조합한다.
참고 자료
- https://docs.archivebox.io/latest/
Draft
웹 아카이빙은 특정 시점의 웹페이지를 나중에도 확인할 수 있도록 콘텐츠와 관련 자원을 보존하는 작업이다.
저장 수준
가장 가벼운 방법은 HTML만 저장하는 것이다. 하지만 image, CSS, script가 외부 URL에 있으면 나중에 페이지가 깨질 수 있다.
Screenshot은 시각적 증거는 잘 남지만 텍스트 검색과 link navigation이 어렵다. PDF도 읽기에는 편하지만 interactive state를 보존하지 못한다.
Full-page Archive
Single-file HTML이나 browser capture는 resource를 함께 묶어 보존성을 높일 수 있다.
대규모 보존에서는 WARC처럼 HTTP response를 기록하는 표준 포맷도 사용된다.
현대 웹의 어려움
로그인, infinite scroll, client-side rendering, video stream은 단순 crawler로 완전히 보존하기 어렵다.
핵심
웹 아카이빙은 하나의 파일포맷 문제가 아니라 무엇을 재현하고 싶은지에 따라 capture 전략을 고르는 문제다.