OpenAI, 자체 칩 '할라피뇨' 벤치마크 공개: 엔비디아 GB300 압도
OpenAI Just Dropped Benchmarks for Their Own Chip, Jalapeño, and It's Beating Nvidia's GB300
핵심 요약
OpenAI가 브로드컴과 공동 개발한 추론용 칩 '할라피뇨'의 성능을 공개하며 엔비디아 대비 높은 효율을 입증했습니다.
- 성능 우위 — 엔비디아 GB300 대비 전력당 처리량 최대 104배 및 낮은 지연 시간 기록함
- 시스템 통합 — 칩, 메모리, 네트워킹, 소프트웨어를 하나로 설계해 데이터 이동 효율 극대화함
- 개발 가속화 — OpenAI의 자체 모델을 칩 설계 과정에 활용하여 개발 속도를 높임
- 향후 계획 — 2026년 말 데이터센터 도입을 시작으로 엔비디아 의존도 점진적 축소 예정
몇 달 동안 애매하게 간만 보더니, OpenAI가 드디어 Broadcom이랑 같이 만든 추론용 칩 'Jalapeño'의 구체적인 수치를 까버렸다. 테스트는 SemiAnalysis의 공개 벤치마크인 InferenceX를 돌렸고, GPT-OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T 이렇게 오픈 모델 3개로 진행함.
Nvidia의 GB200이랑 GB300 랙 시스템이랑 비교한 결과는 이렇다:
-
킬로와트당 처리량 1.5배에서 1.9배 증가
-
엔드 투 엔드 지연 시간 1.7배에서 3.6배 감소
-
가장 빠르고 지연 시간이 짧은 설정에서는 킬로와트당 처리량이 최대 8.6배에서 104배까지 뜀
이게 700W짜리 칩이 1,200W, 1,400W 먹는 Nvidia 장비 상대로 낸 성적이다. SemiAnalysis가 OpenAI 엔지니어들 현장에 불러놓고 직접 돌려봤는데, 지금까지 테스트해 본 Nvidia, AMD, Google 칩 다 통틀어서 이게 제일 셌다고 함.
이게 왜 이기냐 하면, 범용 GPU 위에 소프트웨어를 얹는 방식이 아니라 칩, 메모리, 네트워킹, 서빙 소프트웨어까지 전부 처음부터 하나로 묶어서 설계했기 때문임. 핵심은 연산 장치랑 메모리 사이의 데이터 이동을 최소화하고, KV 캐시 같은 걸 로컬에 박아두는 거다. 이게 에이전트 돌릴 때 존나 중요한데, 에이전트는 단계를 계속 거쳐야 해서 단계마다 생기는 렉이 쌓이면 전체 작업 속도가 개판이 되거든.
발표 내용 중에 웃긴 디테일 하나: 칩 개발 과정에서 OpenAI 모델들이 직접 속도 올리는 데 도움을 줬단다. 그리고 공개 행사 때 누군가 Codex 프롬프트만 써서 둠(Doom)을 이 칩에서 돌려버림.
물론 짚고 넘어갈 건 있다. Nvidia의 최신 Vera Rubin 플랫폼은 이번 테스트에 안 들어갔는데, 사실 OpenAI가 올해 말에 기가와트급으로 돌리겠다고 약속한 건 저거거든. 그리고 이 칩은 모델 학습은 못 하니까 Nvidia가 꽉 잡고 있는 학습 시장은 건드리지도 못함. 게다가 벤치마크는 Jalapeño의 단일 토큰 설정이랑 GB300 구성을 비교한 건데, 실제 Nvidia 환경은 보통 멀티 토큰 예측을 쓰니까 실전에서는 격차가 좀 줄어들 가능성이 높음.
2026년 말부터 OpenAI 데이터 센터에 순차적으로 도입하고, 2027년에는 생산량 늘릴 계획이다. 아직 이 칩을 따로 팔지는 않지만, OpenAI가 앞으로 Nvidia 의존도를 확실히 줄이겠다는 의지는 제대로 보여준 셈이지.
OpenAI 전체 리포트: https://openai.com/index/jalapeno-first-results/



