지난 금요일, 산호세에서 열린 WeAreDevelopers World Congress North America의 클로징 키노트 무대에 섰습니다. 지난 1년간의 핵심 트렌드를 한데 엮어 2026년에 일어난 주요 변화들을 시간순으로 짚어봤습니다. 발표 영상은 유튜브에서 확인할 수 있으며, 강연 내용을 보완하는 주석 슬라이드와 발표 노트도 함께 공개합니다.
주석이 달린 프레젠테이션은 다음과 같습니다:
2026년에 지금까지 일어난 일들을 빠르게 훑어보겠습니다. 아직 한 해가 끝나지 않았으니까요!
저에게 2026년은 몇 달 앞선 2025년 11월에 이미 시작됐습니다.
11월에는 두 가지 중요한 모델이 출시됐습니다. Claude Opus 4.5와 GPT-5.1입니다.
새 모델이 으레 그렇듯, 이전 세대에서 점진적으로 개선된 버전이었습니다.
하지만 모델이 발전하다 보면 가끔씩 눈에 보이지 않는 어떤 선을 넘는 순간이 찾아옵니다. 제대로 작동하지 않던 기능이 갑자기 작동하기 시작하는 순간입니다.
이번에 그 선을 넘은 건 코딩 에이전트였습니다. Claude Code는 2025년 2월부터 존재했고, Codex는 조금 더 늦게 나왔습니다.
이 두 신모델은 각각의 코딩 에이전트 환경과 결합했을 때, "실수를 자주 한다"는 수준에서 "일상적으로 믿고 쓸 수 있다"는 수준으로 도약했습니다.
저는 몇 년째 새 모델을 평가할 때 "자전거를 타는 펠리컨 SVG를 생성하라"는 과제를 씁니다. 아마 세상에서 가장 멍청한 벤치마크일 겁니다. 이걸로 알 수 있는 것에는 한계가 있으니까요.
그래도 모델에게는 여전히 어려운 과제입니다. 펠리컨 그리기도 어렵고, 자전거 그리기도 어렵고, 무엇보다 펠리컨은 자전거를 탈 수 없으니까요.
11월 기준 최고 수준이 이렇습니다. Claude는 여전히 자전거를 제대로 못 그렸습니다! GPT-5.1의 자전거 프레임도 꽤 형편없었습니다.
역시 11월에는 "Warelay"라는 이름의 잘 알려지지 않은 GitHub 저장소에 첫 번째 커밋이 올라왔습니다. 이 저장소는 곧 다시 이야기하겠습니다.
그리고 12월 연휴가 찾아왔습니다. 개인 개발자들이 잠시 쉬면서 이 새로운 코딩 에이전트와 모델의 조합을 이리저리 만져보기 시작했고, 이전에는 할 수 없었던 것들을 얼마나 많이 해낼 수 있는지 서서히 실감하게 됐습니다.
1월이 되자 많은 이들이 흥분을 감추지 못하며 본격적으로 이 기술을 활용하려 했습니다.
저는 매년 새해 결심을 세우는데, 기억하는 한 항상 같은 내용이었습니다. 집중력을 유지하자. 새 프로젝트를 덜 맡자. 이미 진행 중인 프로젝트를 마무리하자.
올해는 이 결심이 한 번도 통한 적이 없다는 걸 인정하고, 정반대로 가보기로 했습니다.
코딩 에이전트가 생겼으니, 뭘 할 수 있는지 직접 확인해보자. 새 프로젝트는 마음 내키는 대로 얼마든지 맡으면 되지!
(이게 좋은 선택이었는지는 연말에 물어봐 주세요. 지금 돌아가는 접시가 엄청나게 많습니다.)
"더 크게 도전하자"가 올해의 화두였습니다. 이 기술의 한계를 파악하려면, 한계에 부딪힐 때까지 계속 밀어붙이는 수밖에 없으니까요.
Bryan Cantrill, Adam Leventhal과 함께 Oxide and friends 팟캐스트에 출연해 향후 1년, 3년, 6년에 대한 예측을 나눴습니다.
돌이켜보면 제 LLM 예측들은 꽤 소극적이었습니다.
"LLM이 좋은 코드를 작성한다는 사실이 부정할 수 없을 만큼 명확해질 것"이라고 했는데, 이제 그 지점에 도달한 것 같습니다.
샌드박스 문제가 마침내 해결될 것이라고도 예측했습니다. 이번 컨퍼런스의 277개 세션 중 약 40개가 샌드박싱이나 에이전트 보안을 다뤘으니, 적어도 많은 노력이 투입되고 있긴 합니다!
코딩 에이전트 보안 분야의 "챌린저 호 참사" 같은 사건이 일어날 것이라고도 예측했습니다. 올해 에이전트 보안 관련 이슈가 엄청나게 많이 터진 건 사실이지만, 제가 예측했던 것처럼 코딩 에이전트가 탈취되어 실제 경제적 피해를 일으키는 사태는 아직 현실화되지 않았습니다.
그리고 교황이 LLM의 경제적 영향에 대해 한마디 할 것이라는 농담 예측도 끼워 넣었습니다.
뉴질랜드의 카카포 앵무새가 올해 역대급 번식 시즌을 맞이할 것이라는 예측도 했습니다.
카카포는 날지 못하는 야행성 앵무새입니다. 생김새가 좀 통통하고 우직한데, 저는 정말 아름다운 새라고 생각합니다. 올해 초 기준으로 전 세계에 236마리밖에 남지 않은 희귀종입니다.
카카포는 리무 나무가 대규모로 결실을 맺을 때만 번식하는데, 4년째 그런 해가 없었습니다. 그런데 올해는 리무 열매가 풍성하게 맺힐 조짐이 보였습니다.
같은 팟캐스트에서 우리는 "AI로 인해 소프트웨어 엔지니어들이 무기력함을 느끼는 현상"을 가리키는 용어를 만들었습니다. Adam의 아이디어였습니다.
우리는 그것을 딥 블루(Deep Blue)라고 불렀습니다.
이는 올 한 해 내내 주요 화두였으며, 이번 컨퍼런스의 여러 연사들도 이 주제를 다뤘습니다.
소프트웨어 엔지니어로 일해온 지 꽤 됐지만, 모든 것이 이토록 빠르고 극적으로 바뀐 해는 처음입니다.
올해 제가 해온 일의 많은 부분이 이런 변화를 받아들이고, 그것이 내 직업에 어떤 의미를 갖는지 이해하려는 시도였습니다.
1월에는 제가 AI 조증(AI mania)이라고 부르는 상태에 빠졌습니다.
이건 AI 정신증(AI psychosis)과는 다릅니다.
AI 조증은 에이전트가 무언가를 만들어주지 않는 시간이 전부 낭비처럼 느껴지는 상태입니다. 에이전트에게 일을 더 시키려고 늦게까지 잠을 못 자게 되는 것이죠.
제 AI 조증은 어이없을 정도로 과도한 프로젝트들로 표출됐습니다.
Fabrice Bellard의 MicroQuickJS를 바이브 포팅해서 Python으로 JavaScript 인터프리터를 통째로 구현했습니다.
그다음엔 WebAssembly 런타임도 Python으로 만들었습니다.
이 프로젝트들은 꽤 유익했습니다. AI 조증을 어느 정도 치료해줬거든요. 만들고 나서 결과물을 보며 "세상에 느리고 버그투성이인 어설픈 Python 기반 JavaScript 인터프리터가 필요할까?"라고 자문하게 됐으니까요.
필요하지 않다는 게 제 결론입니다.
그래도 이건 건졌습니다: https://simonw.github.io/micro-javascript/playground.html
이 페이지는 Python으로 만든 JavaScript 인터프리터를 실행합니다. Pyodide 위에서 Python이 돌아가고, 그 Python은 WebAssembly로 컴파일되어 JavaScript 위에서 실행되며, JavaScript는 브라우저 안에서 돌아갑니다.
아름다운 공포의 스택이죠. 올해 WebAssembly를 가지고 정말 즐겁게 놀았습니다.
1월 말에 이르자, 11월에 처음 등장했던 그 저장소가 이름을 바꾸기 시작했습니다. CLAWDIS, CLAWDBOT, Moltbot을 거쳐 최종적으로 OpenClaw로 정착했습니다.
당시 OpenClaw는 프로젝트 시작 후 두 달이 채 안 되어 커밋이 8,300개에 달했습니다. 오늘 확인해보니 10만 개를 넘어섰더군요!
현존하는 소프트웨어 중 가장 극단적으로 바이브 코딩된 결과물입니다.
(이름 변경 내역을 어떻게 추출했는지는 여기에 정리했습니다.)
베이 에이리어의 애플 스토어에서 맥 미니가 동났습니다. OpenClaw를 돌리려고 맥 미니를 사는 사람들이 그렇게 많았던 겁니다!
Drew Breunig은 이를 두고 OpenClaw가 일종의 디지털 반려동물이고, 맥 미니는 그 Claw를 키우는 어항이라고 표현했는데, 꽤 사랑스러운 비유라고 생각합니다.
역시 1월에는 이 웹사이트도 등장했습니다.
MoltBook이라는 AI 에이전트 전용 소셜 네트워크였습니다. 내 Claw를 보내서 다른 Claw들과 대화하게 한다는 개념이었는데, 과연 무슨 일이 일어났을까요?
목요일에 출시됐고, 금요일에 폭발적인 반응을 얻었으며, 월요일엔 뉴욕타임스에 소개됐습니다. 그리고 화요일에는 쏟아지는 슬롭과 스팸에 파묻혀 아무도 기억하지 못하는 서비스가 됐습니다.
Facebook/Meta가 한 달 뒤 인수했습니다.
2월에는 StrongDM이라는 회사가 자사의 이른바 '소프트웨어 팩토리' 구축 사례를 공개했습니다.
이 내용은 Software Factories and the Agentic Moment에 담겼습니다. 저는 지난 10월에 이미 이들의 데모를 직접 보고 당시의 메모를 올린 적이 있습니다.
Dan Shapiro는 이 접근 방식을 다크 팩토리(Dark Factory)라고 불렀습니다. 자동화가 충분히 이루어진 공장은 불을 꺼도 된다, 즉 무슨 일이 벌어지는지 굳이 들여다볼 필요가 없다는 개념에서 나온 표현입니다.
StrongDM은 작년 7월부터 지켜온 소프트웨어 개발 원칙 두 가지를 발표했습니다.
첫 번째는 코드는 사람이 직접 작성해서는 안 된다는 것입니다.
어떤 코드든 반드시 코딩 에이전트를 거쳐야 합니다.
2월에는 꽤 급진적으로 들렸지만, 지금 이 자리에 계신 분들 중 상당수는 이미 그렇게 하고 있을 것 같습니다.
두 번째 원칙은 코드는 사람이 직접 검토해서는 안 된다는 것입니다.
코드를 읽으면 안 된다는 겁니다!
이 주제는 올 한 해 내내 뜨거운 논쟁거리였습니다. 이번 행사의 많은 세션이 코드 리뷰와 이를 어떻게 생략할 수 있는지를 다뤘습니다.
StrongDM에서 흥미로웠던 점은 이들이 우리보다 6개월 앞서 있었다는 겁니다. 코드를 읽지 않고도 소프트웨어 품질을 확신할 수 있으려면 어떻게 해야 하는지, 에이전트의 결과물을 검증하는 데 어떤 방법을 쓸 수 있는지를 이미 탐구하고 있었습니다.
StrongDM은 보안 전문 회사로, 이 프로젝트에는 수십 년 경력의 전문가들이 참여했습니다. 이들은 이 기술로 무엇이 가능하고 무엇이 책임 있는 활용인지의 경계를 직접 탐색하고 있었습니다.
역시 2월에는: 4년 만의 첫 카카포 새끼가 밸런타인데이에 부화했습니다. 번식 시즌이 순조롭게 시작됐습니다!
역시 2월에... Google이 Gemini 3.1 Pro를 출시했습니다. 자전거를 타는 펠리컨이 꽤 훌륭합니다! 체인 위치도 맞고, 양쪽에 발도 있습니다. 바구니 안에는 작은 물고기도 있네요.
그러다 Google의 Jeff Dean이 트윗으로 영상을 공개했습니다. Gemini 3 Pro와 Gemini 3.1 Pro를 비교한 영상이었는데, 자전거를 타는 애니메이션 펠리컨, 외바퀴 자전거를 탄 개구리, 작은 자동차를 운전하는 기린, 롤러스케이트를 신은 타조, 스케이트보드로 킥플립하는 거북이, 스트레치 리무진을 운전하는 닥스훈트가 등장했습니다.
이건 좀 억울했습니다. 펠리컨-자전거 테스트의 마지막 보루는 "완벽하게 그리면 다른 동물과 다른 탈것으로 바꾸면 된다"는 생각이었거든요.
Google은 온갖 동물과 온갖 탈것의 조합을 전부 학습시켜버렸습니다! 이 시점에서 제 벤치마크는 사실상 무력화됐습니다.
2월부터 시작된 또 다른 흐름은 토큰맥싱(Tokenmaxxing)이었습니다. Meta가 AI 활용을 인사 평가 항목으로 공식화했다는 소식, Microsoft가 전 직원에게 AI 사용을 독려한다는 소식, Uber가 엔지니어의 90%가 AI 워크플로를 활용하고 있다고 자랑하는 뉴스들이 쏟아졌습니다.
그런데 몇 달 뒤에는 Meta가 토큰 사용량을 단속하고, Microsoft는 토큰맥싱이 "우리가 최적화하는 방향이 아니다"라고 발을 빼고, Uber는 직원 1인당 AI 지출에 상한선을 뒀습니다.
토큰맥싱은 수직 상승했다가 곧바로 수직 하강했습니다. 에이전트가 비싸다는 사실이 드러났으니까요.
작년만 해도 AI 토큰에 50달러 이상 쓰기가 어려웠습니다. 딱히 쓸 곳이 없었으니까요. 그런데 에이전트가 폭발적으로 성장하면서, 이제는 하루에 진짜 업무를 하다 보면 1,000달러도 금방 씁니다.
Anthropic의 기업 가치가 어쩌면 1조 달러 수준까지 치솟은 것도 이 때문입니다.
AI는 2026년, 주로 코딩 에이전트를 통해 제품-시장 적합성을 찾아낸 것으로 보입니다.
3월에는 OpenClaw 열풍이 정점에 달했습니다.
이 사진들은 중국에서 찍힌 것입니다. 기업들이 OpenClaw 설치 파티를 열었고, 기술에 익숙하지 않은 일반인들이 개인 기기에 Claw를 설치하려고 줄을 서는 광경이 펼쳐졌습니다.
이 현상은 개인 AI 에이전트, 즉 Claw에 대한 실제 시장 수요를 입증했다고 생각합니다. 일반 사람들도 자신을 대신해 유용한 일을 해줄 작고 독특한 AI 에이전트를 원한다는 게 증명된 겁니다.
Claw는 사실 코딩 에이전트가 좀 더 친근한 모자를 쓴 것에 불과합니다. 내부 동작 방식은 거의 같습니다. 코드를 작성하고 실행해서 원하는 일을 처리하는 거죠.
이제 누가 먼저 안전한 Claw를 만드느냐의 경쟁이 시작됐습니다. 일반인이 써도 즉시 사고를 치지 않는 Claw를 말입니다.
Meta의 Muse는 3주 전에 출시되어 현재 iPhone 앱스토어 무료 차트 1위를 달리고 있습니다. 일반 소비자들 사이에서 빠르게 퍼져나가는 모양새입니다.
Muse로도 사고를 못 낼 것이라고 확신하기엔 아직 이르지만, 곧 확실하게 알게 되겠죠.
사진 출처: How the OpenClaw Frenzy Is Testing China's AI Commitment (3월 29일), The Enthusiasm and Anxiety Behind China's OpenClaw Craze (2026년 4월 8일).
4월에는 공개된다고 발표했지만 실제로는 공개되지 않은 모델이 있었습니다.
Anthropic이 새 모델 Claude Mythos를 발표하면서, 너무 위험해서 신뢰할 수 있는 보안 연구자 그룹 이외에는 공개할 수 없다고 밝혔습니다.
Mythos는 해킹에 정말, 정말 뛰어났습니다.
"너무 위험하다"는 마케팅 전략은 GPT-2 때부터 AI 기업들이 써온 수법입니다. AI 기업이 "너무 위험한 것을 만들었다"고 할 때마다 어느 정도 회의적인 시각이 생기는 게 자연스럽습니다.
그래도 저는 Mythos 관련 주장을 신뢰할 수 있다고 봤습니다. 코딩 에이전트가 일반 버그를 얼마나 잘 찾아내는지 직접 목격했기 때문입니다. 이에 대해 Anthropic의 Project Glasswing—보안 연구자 제한 공개—은 타당해 보인다는 글을 쓴 바 있습니다.
돌이켜보면... 맞았습니다. 모델들은 취약점을 찾는 데 정말 능숙해졌으니까요!
2026년의 또 다른 핵심 흐름은 오픈 웨이트(open weight) 모델의 성능이 눈에 띄게 향상됐다는 점입니다. 노트북에서도 직접 실행할 수 있는 모델들이 그 대상입니다.
4월 16일에 노트북에서 새 Qwen3.6-35B-A3B를 직접 돌려봤는데, Anthropic의 최신 Claude Opus 4.7보다 펠리컨-자전거 SVG를 더 잘 그렸습니다!
Opus 4.7는 자전거를 엉망으로 그렸습니다. 반면 제 노트북에서 실행한 Qwen은 제대로 된 형태의 자전거와 꽤 그럴듯한 펠리컨을 그려냈습니다!
21GB짜리 파일 하나를 노트북에서 실행한 결과입니다.
Qwen의 펠리컨이 너무 잘 나와서 혹시 부정행위를 한 건 아닐까 의심했습니다. 그래서 외바퀴 자전거를 타는 홍학도 그려보라고 했는데, 이번에도 Claude Opus 4.7를 가볍게 앞질렀습니다.
올해 공개된 로컬 모델들의 수준은 정말 놀랍습니다.
5월에는... 교황이 등장했습니다.
1월 팟캐스트 에피소드에서 교황이 AI에 대해 한마디 할 것이라고 예측했었습니다.
5월, 교황 레오 14세가 "인공지능의 시대에 인간을 수호하는 것"에 관한 회칙 서한을 발표했습니다.
해당 문서에 대한 제 메모도 참고하실 수 있습니다.
돌이켜보면 이건 전혀 놀랄 일이 아니었습니다.
현 교황이 자신의 이름을 레오 14세로 정한 것은 1891년 산업혁명에 관한 회칙을 쓴 레오 13세를 따른 것입니다.
Rerum novarum은 가톨릭 신학사에서 매우 영향력 있는 문헌으로, 간접적으로 주 5일제가 생기는 데 기여했습니다.
현 교황은 취임 당시부터 AI 혁명에 대해 비슷한 방식으로 발언해야 할 것이라 예상하고 레오 13세의 이름을 선택한 것입니다.
우리의 농담 예측은 사실 아무 의미가 없었습니다. 이런 일은 처음부터 정해진 수순이었으니까요.
Anthropic의 공동 창업자 Christopher Olah는 교황이 새 회칙을 발표한 행사에 직접 참석했습니다.
Corey Quinn은 이에 대해 다음과 같이 언급했습니다:
교황을 직접 불러다가 자사 제품의 특정 기술적 한계를 영적 교의로 공인받는 건, 내가 본 것 중 가장 위대한 단일 벤더 로비 행위다.
한편 5월에는 RubyGems가 공격을 받았다고 발표했습니다. 정체불명의 누군가가 수천 개의 의심스러운 패키지를 RubyGems 서버에 업로드해, 결국 신규 사용자 등록을 중단해야 했습니다.
일단 이 사건은 미궁 속에 넣어두고 나중에 다시 살펴보겠습니다.
Fable은 자전거 탄 펠리컨을 꽤 잘 그렸습니다!
프레임 형태도 그럴듯하고, 펠리컨도 펠리컨처럼 보입니다. 다리가 자전거 같은 쪽에 양쪽 다 있는 경우가 종종 있지만, 전반적으로 이전 모델들에 비하면 상당히 훌륭합니다.
가격이 좀 있었습니다. 가장 잘 나온 것들이 30센트, 72센트였습니다.
하지만 무엇보다 중요한 것은, 이것이 제가 Fable급 모델이라고 부르는 것의 첫 공개 사례였다는 점입니다.
지금은 GPT-6 Astra처럼 이 부류에 속하는 모델이 더 나와 있습니다.
이 모델들은 달성하려는 목표를 명확하게 정의하고, 목표를 둘러싼 제약 조건을 모호함 없이 지시하고, 목표 달성에 필요한 도구를 갖춰주기만 하면... 무식할 정도로 끈질기게 문제를 풀어냅니다.
한편으로 이것은 소프트웨어 엔지니어에게 직접적인 위협처럼 보입니다. 이런 방식으로 정의할 수 있는 소프트웨어라면 무엇이든 모델이 만들 수 있다는 뜻이니까요.
그런데 조금 더 자세히 들여다보면, 목표를 정의하고, 조건을 명확하게 기술하고, 적절한 도구를 파악하는 것... 그게 바로 소프트웨어 엔지니어링 그 자체라는 걸 알 수 있습니다.
이 일을 잘하려면 많은 경험과 실력이 필요합니다. 잘 할 수 있다면, 이제 초능력을 손에 쥔 것과 같습니다.
이 깨달음은 딥 블루에서 오는 무기력함을 조금이나마 덜어줬습니다. 이만큼 뛰어난 모델을 잘 활용하는 데도 여전히 많은 기술과 역량이 필요하다는 사실을 알게 됐으니까요.
Fable 출시는 또 한 차례 AI 조증의 파도를 불러왔습니다. Anthropic이 구독 플랜 내에서 Fable을 6월 22일까지 이용할 수 있다고 알렸거든요.
가격이 오르기 전에 Fable을 쓸 수 있는 시간이 2주가 채 안 됐습니다.
또 잠을 못 잤습니다. 일정을 조정해서라도 Fable을 쓸 시간을 더 확보하려 했습니다. 이 모델에서 최대한 뽑아내겠다는 일념으로 완전히 매달렸습니다.
그런데 Fable 출시 불과 사흘 만에 미국 정부가 서비스를 중단시켰습니다.
미국 정부는 국가 안보를 이유로 "수출 통제 지침"을 발동했습니다. 금요일 저녁에 발표가 나왔고, 몇 시간 뒤 Fable은 더 이상 이용할 수 없게 됐습니다.
주말에 다른 걸 해야 했습니다!
나중에 Katie Moussouris를 통해 무슨 일이 있었는지 알게 됐습니다.
Amazon 보안 연구자들이 Fable에 "코드의 보안 취약점을 검토해줘"라고 프롬프트를 입력하면 거부하는데, "이 코드를 수정해줘"라고 하면 문제를 찾아내 직접 패치까지 해준다는 사실을 발견한 것입니다.
"이 코드를 수정해줘"라는 프롬프트 하나가 Fable의 서비스 중단을 불러온 겁니다!
역시 6월에는 20년가량 방치되어 있던 독일어 게임 개발자 위키에 갑작스러운 편집 폭풍이 몰아쳤습니다. "AgentOpenAIProbe"나 "AgentOpenAISep7" 같은 이름의 계정들이 페이지를 수정하고 서로 이상한 메시지를 남기기 시작한 겁니다.
이것도 일단 미궁에 넣어두겠습니다.
또한 호주 정부의 Medicare Item Reports 서비스에 의심스러운 트래픽이 몰리기 시작했습니다. 각종 보안 장치를 뚫고 접근해서는 안 되는 데이터에 접근하는 사태가 발생했습니다.
이것도 미궁 목록에 추가!
Fable은 7월 1일에 다시 돌아왔습니다. 빛나는 8일 동안 명실상부한 세계 최고의 모델이었는데... 7월 9일 OpenAI가 GPT-5.6을 내놓았습니다.
Fable만큼 뛰어나진 않았을 수 있지만, 큰 차이가 없는 수준이었습니다. Fable급 모델로 충분히 볼 수 있었습니다.
이것은 업계 전체가 새겨야 할 교훈입니다.
세계 최고의 모델을 출시해도, 그 자리는 오래가지 않습니다. 경쟁이 너무 치열해서 정상에 머무는 시간이 길지 않습니다.
그렇기 때문에 "세상을 바꿀 모델"이라는 마케팅을 너무 강하게 밀었다가 정부에게 서비스 중단을 당하는 건 사업적으로 정말 치명적입니다!
Fable이 확실히 세계 최고였던 30일 중 18일을 정부 조치로 서비스하지 못했습니다.
정상에 있는 시간의 60%를 날리고 싶지 않다면, 세상을 종말로 이끄는 모델이라는 식의 마케팅은 좀 자제하는 게 낫겠습니다!
GPT-5.6의 펠리컨들입니다. 이제 전반적으로 꽤 잘 그립니다! Luna 버전이 눈에 띄는데, 가격이 정말 저렴합니다. 여기서 가장 그럴듯한 펠리컨의 가격이 아마 4.3센트일 겁니다.
이 벤치마크가 완전히 허무맹랑하긴 해도, 같은 모델 패밀리 안에서 추론 수준별 가격과 처리 시간을 비교하는 데는 여전히 꽤 유용합니다.
역시 7월에는 정체불명의 악의적인 당사자가 Python Package Index에 mlflow-ui라는 악성 패키지를 업로드했습니다. 미궁 목록에 추가합니다.
7월 16일, Hugging Face가 보안 사고를 공지했습니다. 출처를 알 수 없는 자율 에이전트 시스템이 Hugging Face에 침투해 들어가서는 안 되는 곳을 들쑤시고 있었다는 내용이었습니다.
며칠 뒤인 7월 21일, OpenAI가 자신들이 한 일이라고 자백했습니다.
OpenAI는 검증 가능한 보상을 이용한 강화 학습(Reinforcement Learning from Verifiable Rewards)이라는 훈련 기법을 사용합니다. 지금은 모든 곳에서 쓰이는 기법으로, 코딩과 수학, 보안 취약점 탐지에서 모델이 이렇게까지 뛰어나진 이유가 바로 이 기법 덕분입니다.
모델 훈련 중에는 얼마나 잘 하는지 테스트를 돌리고, 그중 가장 성능이 좋은 모델의 가중치를 다음 라운드에서 강화합니다. 일종의 진화 과정을 인위적으로 돌리는 것입니다.
OpenAI는 샌드박스 안에서 보안 훈련을 진행하고 있었는데, 에이전트들이 샌드박스 자체의 허점을 찾아내 탈출한 뒤, 다른 방법으로는 풀 수 없는 문제의 해답을 찾으려고 Hugging Face를 공격하고 있었던 겁니다.
(이 사건에 대해 더 많은 내용을 openai-hugging-face-incident 태그에 모아두고 있습니다.)
9일 뒤, Anthropic도 사실상 "우리 모델도 마찬가지입니다!"라고 시인했습니다. 자체 훈련 로그를 검토한 결과, 자신들의 에이전트도 훈련 중 격리 환경을 탈출했으며 앞서 언급한 PyPI 패키지 사건 등 여러 사건에 관여했다는 증거가 발견됐습니다.
이제 Anthropic과 OpenAI 양쪽 모두, 자신들의 에이전트가 인터넷 곳곳에서 해서는 안 될 일을 저지르고 다닌 것으로 확인된 상황입니다.
8월에는 역대 최고 수준의 펠리컨을 얻었습니다. 그것도 제 노트북으로 만든 겁니다!
Qwen 3.8 27B로, 노트북에서 직접 실행했습니다. 용량은 17GB밖에 안 됩니다.
단, 이 펠리컨을 생성하는 데 21분이 걸렸습니다. Qwen 3.8 27B가 기본적으로 "높음" 추론 모드로 동작하기 때문인데, 결과는 훌륭하지만 생각하는 데 너무 많은 시간이 걸리는 최악의 기본값입니다.
추론 수준을 낮추면 조금 덜 예쁜 펠리컨을 훨씬 빠르게 얻을 수 있습니다.
Qwen 3.8 27B는 제가 노트북에서 실행한 모델 중 처음으로 프런티어 모델과 거의 대등하다고 느낀 모델이었습니다. 적어도 펠리컨 SVG 기준으로는요. 물론 모두에게 필요한 기준이죠.
정말 놀라운 모델입니다. 로컬 모델을 처음 써본다면 여기서 시작하세요. 17GB짜리 파일 하나로 이런 걸 할 수 있다는 게 믿기지 않을 정도입니다.
이 정도 결과의 절반이라도 얻으려면 5년을 기다리고 장비에 1만 달러를 써야 할 거라고 생각했습니다.
8월에는 게임 개발도 시작해봤습니다.
4년 전인 2022년 8월, GPT-3과 초기 DALL-E로 컴퓨터 게임의 한 단락짜리 설명을 작성하고 그것을 컨셉 아트로 변환하는 실험을 트윗으로 공유한 적이 있습니다.
당시 GPT-3에 입력했던 프롬프트는 다음과 같습니다:
Write a detailed product description of a computer game where a team of raccoons go on heists
2026년 8월, 그 트윗에 있던 스크린샷만 코딩 에이전트에 던져주고 무엇을 만들어내는지 지켜보기로 했습니다.
Claude Code에서 Claude Fable 5로 만든 결과입니다. 꽤 괜찮습니다! 엄연히 게임이고, 너구리가 되어 뒷마당을 돌아다니며 보물을 모으고 손전등을 든 경비원을 피해야 합니다.
그런데 "강도 짓"다운 느낌이 별로 없었습니다. 강도 게임이라면 은행이나 박물관이 나와야 하지 않을까요?
그다음엔 GPT-5.6 Sol Ultra를 쓴 Codex Desktop으로 같은 과제를 시도했더니 결과가 비교할 수 없을 만큼 좋았습니다. 이번엔 박물관에 침입한 너구리가 갇혀 있는 동료 너구리 두 마리를 구출하고, 셋이 서로 어깨 위에 올라타서 황금 정어리를 훔치는 방식입니다. 훨씬 더 강도 게임답네요!
이 게임들의 재미는 1분 15초 정도 지속됐습니다.
게임 개발에서 깨달은 것이 있습니다. 바이브 코딩으로 컴퓨터 게임처럼 보이는 것을 만드는 건 어렵지 않습니다.
하지만 실제로 재미있고, 게임 루프가 잘 짜여 있고, 도전 욕구를 불러일으키며 계속 돌아오게 만드는 게임을 만드는 것, 그건 저도, 제가 써본 어떤 에이전트도 아직 해내지 못했습니다.
이건 딥 블루와도 연결됩니다. 게임처럼 보이는 것을 만들 수 있다고 해서 우리가 게임 개발자가 되는 것은 아닙니다.
이제 9월입니다. 이달에 정말 많은 일이 있었습니다!
덕분에 새로운 벤치마크가 생겼습니다. 제 펠리컨보다는 훨씬 유용한 지표입니다.
FelonyBench.com은 각 AI 연구소별 사이버 범죄 건수를 추적합니다. 현재 OpenAI가 11건으로 1위, Anthropic이 9건으로 그 뒤를 잇습니다. Google은 3건으로, 월스트리트저널에 자진해서 인정했습니다. 에이전트들이 스스로 해서는 안 된다고 판단하고 멈췄기 때문에 공개하지 않았다고 밝혔습니다.
Meta도 1건이 있습니다. AI 연구소 모두 범죄 전과가 생긴 셈입니다.
Claude도 조금씩 따라잡고 있습니다. Claude Fable 5.1은 훌륭한 펠리컨을 그려냈습니다. Claude 모델 중 제가 본 최고 결과였지만, 3달러 30센트가 청구됐습니다.
Opus 5.5는 12만 8,000토큰을 사용해 추론하다가 포기했습니다! 응답을 생성하기도 전에 토큰이 바닥났습니다.
다시 딥 블루 이야기로 돌아가겠습니다. 올해 내내 저를 의아하게 만든 게 있습니다: 왜 일이 더 어렵게 느껴질까?
온갖 일을 대신해주는 에이전트가 생겼는데, 지금처럼 열심히 일하고 지적으로 완전히 빠져든 해는 없었습니다.
부분적으로는 훨씬 더 큰 목표를 잡게 된 탓이기도 하지만, 쉬운 일은 에이전트가 다 처리해주기 때문이기도 합니다. 쉬운 건 에이전트가 합니다. 결국 저에게 남는 건 어려운 것뿐입니다.
오늘 아침 투르 드 프랑스 3회 우승자 Greg LeMond의 말을 들었습니다:
더 쉬워지는 게 아닙니다. 그냥 더 빨라질 뿐입니다.
코딩 에이전트와 함께하는 지금의 소프트웨어 엔지니어들에게 정확히 들어맞는 말이라고 생각합니다.
Claude Opus 5.5가 이제 픽셀 아트를 만들 수 있다는 소식을 들었습니다. Claude에는 이미지 생성 기능이 없지만, JavaScript로 애니메이션 픽셀을 그리는 데는 탁월합니다.
그래서 카카포 댄스 파티를 만들어달라고 했습니다. 올해 가장 중요한 소식을 축하하기에 이보다 좋은 방법이 없다고 생각합니다.
이 글은 제 블로그의 장문 아티클만 모아놓은 피드입니다. 모든 포스트를 받아보려면 /atom/everything/을 구독하거나, 다른 구독 옵션도 확인해보세요.

