Claude에게 920만 개의 뉴스 기사를 분석해달라고 요청해 본 결과
I asked Claude to go through 9.2 million news articles, here's what I got
핵심 요약
920만 개의 뉴스 기사를 클러스터링하여 분석한 결과, 대부분의 뉴스가 반복적이며 실제 사건 대비 기사 비율이 12:1에 달한다는 흥미로운 통계를 공개했습니다.
- 뉴스 중복성 — 실제 사건 하나당 12개의 기사가 작성될 정도로 뉴스 생태계가 반복적임
- 정보 수명 — 기사의 82%가 3일 이후에도 계속 전개되지만 언론사들은 보도를 중단함
- 데이터 분석 — Claude를 활용해 920만 건의 기사를 분석하고 시각화 자료를 생성함
- 개발자 도구 — 뉴스 데이터를 활용할 수 있는 REST API와 MCP 서버를 오픈함
요즘 하루에 뉴스 기사를 최대 10만 개 정도 읽어 들이는 사이드 프로젝트를 하나 시작했어(전체 평균은 6만 3천 개 정도). 같은 사건을 다루는 기사들을 묶어서 뉴스 노이즈를 제거하는 작업이지.
145일 동안 데이터를 긁어모은 뒤에, 지금까지 쌓인 데이터를 Claude한테 분석해 보라고 시키고 그 통계를 공개했거든? 위에서 내려다본 뉴스판은 진짜 가관이더라.
-
12:1 - 실제로 일어난 사건 하나당 쏟아지는 기사 수야. 뉴스는 그냥 메아리나 다름없어.
-
기사의 82%는 3일이 지나도 계속 진행 중 - 근데 뉴스 사이트들은 딱 그쯤 되면 기사를 안 보여주기 시작하지.
-
한 세계 지도자는 한 달 동안 3,200개의 서로 다른 사건에 언급됐어(누군지 알겠지?) - 그다음으로 많이 언급된 인물 5명을 다 합친 것보다 많아.
-
"예외적"이라고 할 만한 사건은 고작 **0.07%**뿐이야. 나머지는 거의 다 평범하고 지루한 일상이지.
전체 차트 확인: clstr.news/observatory
(차트도 Claude랑 티키타카 하면서 만든 건데, 의외로 적절한 시각화 방식을 골라내는 센스가 있더라고.)
내 프로젝트 소개 좀 하자면: CLSTR은 4만 개 이상의 소스에서 하루 10만 개의 기사를 읽어 들여서, 같은 사건을 다루는 것끼리 묶어 하나로 압축해 줘. 관련 사건들은 "상황(situations)"으로 엮어서 타임라인을 보여주니까, 똑같은 헤드라인을 20번씩 다시 읽을 필요 없이 이야기가 몇 주 동안 어떻게 전개됐는지 한눈에 볼 수 있어.
2주 전부터는 에이전트들도 이 프로젝트를 쓸 수 있게 열어뒀어. REST API랑 원격 MCP 서버를 지원하고, 기본 사용량은 둘 다 무료야.
MCP URL: mcp.clstr.news
API 문서: clstr.news/developers

