올해 초 Anthropic은 외부 연구자들에게 실제 Claude 사용 집계 데이터에 접근권을 제공하는 파일럿 프로그램을 운영했습니다. 세 개의 연구 그룹이 프라이버시 보호 분석 도구인 Anthropic Insights를 활용해 각자의 연구를 직접 설계했으며, Anthropic은 연구 그룹을 대신해 데이터를 수집하고 각 그룹은 독립적으로 분석을 수행했습니다. 이 글에서는 각 연구의 주요 결과와 파일럿을 통해 배운 점을 공유합니다. 향후 협업을 희망하는 연구자를 위한 사전 관심 등록 양식도 함께 제공합니다.
AI 전환이 순조롭게 이루어지려면 사람과 사회에 미치는 영향을 제대로 파악해야 합니다. 현재 실제 AI 상호작용 데이터는 소수의 연구소에 집중되어 있습니다. Anthropic은 이 데이터가 연구자, 정책 입안자, 일반 대중에게 폭넓게 공개되어야 한다고 생각합니다.
연구소 외부의 연구자들이 활용할 수 있는 방법은 두 가지입니다. 실제 사용 데이터를 바탕으로 하지만 대개 해당 연구소의 관심사에 맞춰 작성된 분석 자료에 의존하거나, 원하는 방식으로 연구할 수 있지만 캐주얼한 사용 패턴에 치우쳐 있어 실제 AI 이용 실태를 제대로 반영하지 못할 수 있는 공개 데이터셋을 활용하는 것입니다. 어느 쪽도 AI가 실제로 어떻게 활용되는지를 독립적으로 연구하기에는 충분하지 않습니다.
올봄, Anthropic은 세 개의 외부 연구 기관이 Anthropic Insights(구 'Clio')를 통해 Claude 사용 데이터를 직접 연구하는 파일럿 프로그램을 운영했습니다. Anthropic Insights는 내부 팀이 수백만 건의 Claude 대화에서 사용 패턴을 분석할 때 활용하는 프라이버시 보호 도구입니다. 향후 이 프로그램을 확대할 계획인 만큼, 제3자 연구자와 공유된 모든 데이터에 대해 추가적인 프라이버시 감사를 실시하여 보호 조치가 제대로 작동하는지 검증했습니다(부록 참조).
이번 프로그램은 외부 연구자들이 AI 기업 자체 사용 데이터를 토대로 공개적인 독립 연구를 수행한 첫 사례로 알려져 있습니다. 아래에서는 외부 연구팀의 발견, 파일럿 운영을 통해 배운 점, 그리고 프로그램 확대를 위해 검토 중인 사항들을 다룹니다. 또한 각 프로젝트의 집계 데이터도 공개합니다.
Anthropic은 스탠퍼드 대학교의 사회·언어 기술 연구소(SALT Lab, Social and Language Technologies Lab), 옥스퍼드 대학교의 인간 정보 처리 연구소(Human Information Processing Lab), 그리고 최전선 AI 모델을 평가하는 비영리 기관 METR과 협력했습니다. 각 그룹은 자체 연구 질문을 설계하고 Anthropic Insights를 활용해 2026년 4~5월 사이의 Claude.ai 또는 Claude Code 대화 약 25만 건을 프라이버시 보호 방식으로 분석했습니다.
Anthropic은 외부 파트너들의 독립성을 최대한 보장하고자 했습니다. 계약상 검토 권한은 사용자 프라이버시, 이용 정책 위반에 악용될 수 있는 정보, Anthropic의 기밀 정보, 그리고 연구의 정확성에 한정했습니다. 연구 내용에 대한 Anthropic의 개입은 없었으며, 연구자들은 Anthropic에 불리한 결과라 하더라도 자유롭게 발표할 수 있습니다. 아래는 초기 결과 일부입니다. 연구 방향성과 데이터 공개 이후 다른 연구자들이 발견하게 될 내용에 기대가 큽니다.
SALT Lab은 인간이 AI와 어떻게 협업하는지를 연구했습니다. 사람들이 AI에 어떤 유형의 작업을 맡기는지, 그 과정에서 어떤 역할을 직접 담당하는지, 그리고 인간-AI 협업이 어떤 지점에서 무너지는지를 살펴봤습니다. 주요 발견은 다음과 같습니다.
전체 연구 내용은 여기에서 확인할 수 있습니다.
인간 정보 처리 연구소는 사람들이 Claude를 사용하는 동안 어떤 감정을 경험하는지, 그리고 그 감정이 Claude의 행동 방식과 어떻게 연결되는지를 연구하고 있습니다. 초기 결과는 다음과 같습니다.
현재 연구팀이 보고서를 작성 중이며, 공개되는 대로 링크를 추가할 예정입니다.
METR은 코딩 에이전트가 실제 업무에서 가져오는 생산성 향상 효과와 모델 세대에 따른 변화를 측정하고 있습니다. Claude Code 대화 분석이 아직 진행 중이지만, 초기 결과는 다음을 시사합니다.
현재 연구팀이 보고서를 작성 중이며, 공개되는 대로 링크를 추가할 예정입니다.
AI 분야에서 사용 데이터 공유는 전례가 드문 일입니다. 따라서 이번 파일럿은 제3자 연구를 프라이버시 보호 방식으로 지원하는 시도인 동시에, 그러한 프로그램을 운영하는 방법 자체를 실험하는 과정이기도 했습니다. 사용자 프라이버시 보호와 연구자 독립성 확보 모두 최우선 과제였으며, 두 가지 모두 달성했습니다. Anthropic Insights는 이 목적에 맞게 설계되어 연구자들이 원시 대화에는 접근하지 않고, 내부 작업과 동일한 법적·프라이버시 검토를 거친 집계 결과만 확인할 수 있습니다. 다만 이러한 절차로 인해 일반적인 AI 연구소의 속도에 비해 파일럿 진행이 느렸고, 운영에도 상당한 리소스가 필요했습니다. 두 가지 모두 효과적인 확대에 걸림돌이 됩니다. 파일럿 운영 방식에 대한 자세한 내용은 부록을 참조하세요. 아래에서는 배운 점과 과제 해결 방식을 살펴봅니다.
같은 문제를 다양한 시각에서 접근하는 것은 가치 있다. 파트너들의 연구 질문 중 일부는 내부에서 진행 중인 연구와 겹쳤습니다. 예를 들어 METR의 제안은 "에이전트 코딩과 전문성의 지속적 수익"에 관한 Anthropic의 경제 연구와 유사한 방향이었습니다. 이러한 중복은 오히려 유익했습니다. 외부 연구자들이 유사한 데이터를 검토하고 자체적인 결론을 도출할 기회가 됐기 때문입니다. 그 결론이 Anthropic의 결론과 일치하는지는 연구가 계속되는 과정에서 지켜볼 예정입니다. 또한 METR을 Anthropic의 경제학 팀과 연결해 주었는데, 이 협력이 양측 연구 모두에 긍정적인 영향을 주었습니다.
내부에서 효과적이었던 연구 방법도 외부 파트너에게는 맞게 조정해야 한다. Anthropic Insights를 사용할 때 연구자는 "이 사람은 어떤 종류의 도움을 요청하고 있나요?"와 같은 질문을 작성하면, Claude가 연구 대상의 모든 대화에 대해 그 질문에 답변합니다. 답변은 카테고리로 집계되고, 연구자들은 최종 카테고리와 각 카테고리에 해당하는 대화 비율만 확인할 수 있습니다. Claude의 판단에 의존하는 구조이기 때문에, 이 도구는 질문의 표현 방식에 민감합니다. 질문이 부적절하게 작성되면 대화가 실제와 다른 카테고리로 분류될 수 있습니다. 원본 대화를 직접 확인할 수 없기 때문에 이런 오류는 발견하기 어렵습니다.
내부에서는 이 문제를 수 주에 걸쳐 질문을 반복적으로 다듬는 방식으로 해결합니다. 그러나 외부 파트너들은 그렇게 할 수 없었습니다. 데이터셋을 공유할 때마다 반복적으로 프라이버시 검토를 거쳐야 한다면 연구 자체가 불가능해지기 때문입니다. 대신 인간-AI 대화 공개 데이터셋인 WildChat에서 질문을 테스트하도록 했는데, 이 데이터셋에서는 원본 대화와 답변을 직접 대조해 볼 수 있습니다. 하지만 WildChat은 캐주얼하고 창의적인 사용에 치우쳐 있어 Claude 트래픽과 성격이 다릅니다. 그 결과 WildChat에서 잘 작동하던 질문이 실제 Claude 대화에 적용됐을 때 잘못된 카테고리를 만들어 내는 경우가 있었습니다. 이 문제는 Anthropic Insights 결과 해석 방법에 대한 가이드를 제공하는 방식으로 해결했습니다(부록 참조). 앞으로는 외부 연구자들이 사전에 질문과 카테고리를 더 효과적으로 개발할 수 있는 방법을 모색하고 있습니다.
악용 사례를 투명하게 공개하되, 그 방법이 악용되지 않도록 관리하기. 파트너들의 Anthropic Insights 분석 결과 중 일부에서 이용 약관 또는 서비스 약관 위반 사례가 드러났습니다. 예를 들어 금지된 활동에 대한 조언을 구하는 카테고리가 나타났습니다. Anthropic은 플랫폼 악용 실태를 공개해야 한다고 생각하기 때문에 대부분의 위반 사례를 공유했습니다. 단, 사용자들이 무엇을 시도했는지가 아니라 어떻게 안전장치를 우회했는지를 구체적으로 설명하는 카테고리는 예외로 했습니다. 각 연구에서 영향을 받은 카테고리와 대화는 5% 미만이었으며, 수정하거나 삭제한 항목과 그 이유를 연구자들에게 모두 알렸습니다. Anthropic Insights에서 이러한 위반 사례가 발견될 경우 집계 데이터를 안전장치 팀에 공유해 검토하는 것을 표준 프로세스로 삼고 있으며, 이는 향후 외부 연구자와의 협업에서도 중요한 절차로 유지될 것입니다.
AI가 사회에 미치는 영향을 파악하는 일은 AI 기업 혼자 감당하기에는 너무 큰 과제입니다. 실질적인 감시와 검토를 위해서는 외부 연구자들이 실제 사용 데이터를 바탕으로 스스로 질문을 설계하고, 그 결과를 독립적으로 발표할 수 있어야 합니다.
이번 파일럿은 하나의 실험이었습니다. 외부 연구자들이 사용자 프라이버시를 침해하지 않으면서 Anthropic 플랫폼에서 독립적인 연구를 수행할 수 있을까? 예상보다 훨씬 많은 어려움이 있었고 많은 것을 배웠지만, 지금까지의 답은 '가능하다'입니다. 파트너들은 Anthropic이 스스로 설계하지 못했을 연구를 수행했으며, 각 연구는 AI의 실제 영향에 대한 새로운 시사점을 제공했습니다. 유망한 첫걸음이지만, 앞으로 해야 할 일이 훨씬 많습니다.
다음 단계는 이 프로그램을 확대할 수 있는지 판단하는 것입니다. 위에서 언급한 제약 내에서 어떤 유형의 연구를 지원할 수 있는지, 그리고 동시에 얼마나 많은 연구를 운영할 수 있는지 모두 검토해야 합니다. 프라이버시, 안전, 연구 품질을 보장하기 위해 신중하게 시작하려 합니다. 연구자들의 관심도와 연구 주제를 파악하고 싶습니다. 연구자로서 Anthropic Insights에 접근할 수 있다면 지금은 불가능한 연구를 수행할 수 있다고 생각하신다면 이 양식을 작성해 주세요.
전체 부록은 여기에서 확인할 수 있습니다. 세 파트너를 선정한 방법, 프로그램의 목표와 Anthropic Insights 활용 방법을 설명하기 위해 작성한 연구 입문 자료, 각 프로젝트가 제안 단계에서 연구 설계, 분석 단계로 이어지는 과정을 상세히 기술합니다. 또한 협력 계약서의 세부 내용도 포함되어 있는데, 계약서에는 파트너들이 Anthropic에 불리한 결과라도 자유롭게 발표할 수 있다는 내용이 명시되어 있습니다. 아울러 임페리얼 칼리지 런던이 수행한 제3자 프라이버시 감사와 공개 데이터에 적용된 프라이버시 위협 모델에 대해서도 다룹니다. 파트너들의 Anthropic Insights 연구 데이터 해석을 위한 가이드도 함께 제공합니다.
Kunal Handa는 프로젝트 총괄, 파트너들의 연구 제안 협력, 연구 가이드 및 계약서 초안 작성, 파트너들의 Anthropic Insights 연구 실행, 파트너 연구를 지원하는 기술 인프라 구축 참여, Anthropic Insights 결과물 내부 검토, 블로그 포스트 작성을 담당했습니다. Miranda Zhang은 파트너십 및 커뮤니케이션 조율과 전반적인 업무 전체에 기여했습니다. Gabriel Nicholas는 제3자 프라이버시 감사 및 Anthropic Insights 결과물 내부 검토 조율과 전반적인 업무 전체에 기여했습니다. Miles McCain은 Anthropic Insights 결과물 해석 가이드 작성, 파트너 연구 지원 기술 인프라 개발, Anthropic Insights 결과물 내부 검토 참여, 블로그 포스트와 프라이버시 위협 모델 피드백을 담당했습니다. Ryan Heller는 파트너 연구 지원 기술 인프라 구축에 기여했습니다. Saffron Huang은 Anthropic Insights 결과물 내부 검토와 핵심 피드백 및 토론에 기여했습니다. Thomas Millar와 Suzanne Wang은 파트너 연구 지원 기술 인프라 구축과 Anthropic Insights 결과물 내부 검토에 기여했습니다. Shan Carter, Mo Julapalli, Matt Kearney, Sarah Pollack, Judy Shen은 Anthropic Insights 결과물 내부 검토에 기여했습니다. Matthew Jagielski는 프라이버시 위협 모델에 기여했습니다. Shaoyi Zhang은 파트너 연구 지원 기술 인프라 구축에 기여했습니다. Heather Whitney, Ankur Rathi, Aisling Keenan, David Saunders는 프로젝트 전반의 법적·프라이버시 자문을 제공했습니다. Jake Eaton과 Sylvie Carr는 블로그 포스트의 구성과 작성에 기여했습니다. Jack Clark과 Michael Stern은 전 과정에 걸쳐 귀중한 지도, 지원, 토론을 제공했습니다. Deep Ganguli는 프로젝트 전 단계에 걸쳐 상세한 지도, 조직적 지원, 피드백을 제공했습니다.
아울러 유익한 아이디어, 토론, 피드백, 지원을 제공해 주신 Miriam Chaum, Ishita Dasgupta, Esin Durmus, Adam Farina, Zoe Hitzig, Jerry Hong, Devin Kuokka, Hendson Lin, Maxim Massenkoff, Peter McCrory, Maryam Quasto, Nitarshan Rajkumar, Amie Rotherham, Divya Siddarth, Taylor Sorensen, Jerome Swannack, Alex Tamkin, Molly Villagra, Scott White, Charles Yang께 감사드립니다.
스탠퍼드 SALT Lab의 Vishakh Padmakumar, Yijia Shao, Jennifer Wang, Diyi Yang, Dora Zhao, 옥스퍼드 인간 정보 처리 연구소의 Tsvetomira Dumbalska, Hannah Rose Kirk, Christopher Summerfield, METR의 Joel Becker(현 Anthropic 소속), Daniel Paleka, Parker Whitfill께 이번 프로그램의 파트너로 함께해 주신 것에 깊이 감사드립니다.
제3자 프라이버시 감사를 진행해 주신 Zexi Yao, Bozhidar Stevanoski, Peter Romov, Euodia Dodd, Xiaoxue Yang, Nataša Krčo께 감사드립니다.
@online{handa2026enablingindependentresearch,
author = {Kunal Handa and Miranda Zhang and Gabriel Nicholas and Miles McCain and Ryan Heller and Saffron Huang and Thomas Millar and Suzanne Wang and Shan Carter and Mo Julapalli and Matt Kearney and Sarah Pollack and Judy Shen and Matthew Jagielski and Shaoyi Zhang and Heather Whitney and Ankur Rathi and Aisling Keenan and David Saunders and Jake Eaton and Sylvie Carr and Jack Clark and Michael Stern and Deep Ganguli},
title = {Enabling independent research on how people use Claude},
date = {2026-08-26},
year = {2026},
url = {www.anthropic.com/research/enabling-independent-research},
}