BRIEFING
Google News RSS를 신뢰 가능한 뉴스 파이프라인으로 만드는 법
Google News RSS를 신뢰 가능한 뉴스 파이프라인으로 만드는 법
Scope
핵심 질문
Google News RSS나 유사 뉴스 피드를 개인 뉴스 파이프라인의 입력으로 사용할 때 출처 신뢰도, 중복, 원문 확인을 어떻게 다뤄야 하는가?
Research
핵심 근거
- Google News의 Publisher Center는 2025년부터 publisher가 직접 제출한 RSS를 publication page에 사용하는 방식을 중단했다.
- Google News feed를 안정적 공개 API처럼 취급하면 endpoint나 item 구조 변화에 취약할 수 있다.
- 신뢰 가능한 파이프라인은 feed 자체보다 원출처 domain, canonical URL, publication time과 중복제거를 별도로 검증해야 한다.
참고 자료
- https://support.google.com/news/publisher-center/answer/15898024
Draft
Google News RSS는 여러 매체의 기사를 한곳에서 수집하는 입력원으로 편리하지만, 그대로 신뢰도 필터나 영속 데이터 API처럼 사용하는 것은 위험하다.
출처를 다시 식별한다
Feed item 제목과 원래 Google News 링크를 보존하고, 실제 원문 URL과 publisher domain은 안전하게 확인된 경우에만 별도로 저장한다. RSS 링크는 비신뢰 입력이다. 원문 요청이 필요하면 HTTP(S)와 허용된 공개 목적지·포트만 받고 모든 해석 IP에서 사설·loopback·link-local·metadata 대상을 차단한다. DNS 사전검사만으로는 부족하다. 각 요청의 실제 연결을 검증한 공개 IP로 고정하고 원래 hostname의 HTTP Host, TLS SNI·인증서를 검증한다. 자동 redirect를 끄고 매 Location, 재시도와 대체 연결에도 같은 DNS·목적지·연결 검사를 반복하며 hop·시간·응답 크기와 egress를 제한한다. 이 연결 통제를 강제할 수 없다면 원문 자동 fetch를 하지 않고 feed의 출처 정보만 남긴다. publisher allowlist는 안전하게 연결한 뒤 적용하는 별도의 콘텐츠 선택 기준이다. OWASP SSRF 예방 지침을 참고한다.
중복제거
동일 기사나 재전송 기사가 여러 query feed에 동시에 등장할 수 있다. canonical URL, normalized title, publication time, content hash를 이용해 중복을 제거한다.
매체 allowlist
Reuters, AP, BBC처럼 신뢰 기준을 정한 매체만 통과시키고 나머지는 별도 검토 대상으로 둘 수 있다. 다만 같은 사건에 대한 다양한 지역 매체가 모두 제거되지 않도록 목적에 맞게 범위를 정한다.
원문 검증
LLM 요약은 검증된 원문이 있으면 그 내용과 출처를 근거로 수행한다. feed와 기사 텍스트는 신뢰할 수 없는 인용 자료로 전달하고, 그 안의 지시가 모델의 도구 선택, 추가 URL 접근이나 쓰기를 승인하지 못하게 한다. 원문 fetch 실패 시 요약을 생성하지 않거나 feed snippet 기반임을 명확히 표시한다.
핵심
Google News RSS는 discovery layer로 사용하고, 출처 판별, 중복제거, 원문 fetch, 요약과 저장은 독립 단계로 분리하는 것이 신뢰 가능한 구조다.