OpenAI, Cerebras에서 14배 빠른 GPT-5.6 Sol Ultrafast 프리뷰 공개
OpenAI Previews GPT-5.6 Sol Ultrafast at 14x Speed on Cerebras
핵심 요약
OpenAI가 Cerebras와 협력하여 기존 대비 14배 빠른 GPT-5.6 Sol Ultrafast 모드를 공개하며, 실시간 에이전트 작업의 효율성을 극대화할 것으로 기대됨.
- 성능 향상 — 기존 대비 14배 빠른 속도와 초당 750 토큰 생성 가능함.
- Cerebras 협력 — 초저지연 추론을 위해 특수 실리콘 하드웨어를 활용함.
- 실무 활용 — 코드 작성, 로그 분석, 실험 반복 등 생산성 도구로 사용됨.
- 에이전트 혁신 — 응답 속도 개선으로 실시간 계획 및 자가 검증이 가능해짐.
OpenAI가 조용히 역대 가장 빠른 추론 티어를 제한적 프리뷰로 공개했는데, 이 수치가 실제 운영 환경에서도 유지된다면 이 모델을 기반으로 만드는 모든 인터랙티브 서비스의 지연 시간(latency) 예산 자체가 완전히 뒤바뀔 판이다. Help Net Security에 따르면, Ultrafast 모드의 GPT-5.6 Sol은 표준 처리 방식보다 최대 14배 빠르고 초당 최대 750개의 출력 토큰을 생성한다. 이 기능은 OpenAI API를 통해 일부 고객에게만 제공되며, 초저지연 추론을 위한 양사 파트너십의 일환으로 Cerebras가 구동을 맡았다.
프리뷰 고객들은 현재 코딩, 커머스, 금융 리서치, 고객 지원 등 다양한 인터랙티브 애플리케이션 운영 환경에서 Ultrafast를 테스트 중이라고 한다. Jane Street에서 AI 어시스턴트 업무를 맡고 있는 존 크레페지(John Crepezzi)는 Cerebras가 제공하는 속도 향상 덕분에 "모델을 활용하는 방식 자체가 달라졌고", 개발자들이 "모델과 함께 훨씬 더 집중력 있고 생산적으로 일할 수 있게 됐다"고 평가했다. OpenAI도 자사 기술을 직접 써먹고 있다. 내부적으로는 로그 읽기, 트레이스 분석, 대화 요약, 후속 조치 확인, 수정 사항 준비 및 검증 등 인시던트 대응에 이 모드를 활용 중이다. 원래라면 밤새 실험을 돌리고 다음 날 아침에 결과를 확인해야 했던 연구팀들도 이제는 근무 시간 중에 여러 번 반복 실험을 끝낼 수 있게 됐다고 회사는 밝혔다.
이런 변화가 바로 최신 모델 기반으로 서비스를 만드는 사람들에게 핵심이다. 응답 속도가 10초에서 1초로 줄어들면 제품의 패턴 자체가 바뀐다. 에이전트 루프는 사용자 턴마다 더 많이 계획하고 스스로 검증할 수 있게 되고, 코딩 어시스턴트는 더 이상 배치 작업처럼 느껴지지 않으며, '타이핑'하는 동안 기다려야 했던 인터페이스는 즉각적인 답변을 주는 인터페이스로 변한다. 우리 트래커가 특정 최신 모델과 연계된 Cerebras의 처리량 주장을 기록한 건 최근 3개월 사이 벌써 두 번째다. 지난 5월의 조 단위 파라미터 벤치마크까지 고려하면, 이제 특수 실리콘은 단순한 호기심 수준을 넘어 OpenAI가 자사 제품 라인업을 세분화하는 핵심 요소로 자리 잡은 모양새다.
다만 짚고 넘어갈 점도 있다. Help Net Security는 가격, 용량, 정식 출시 일정에 대해서는 밝히지 않았고, 14배 속도나 초당 750 토큰이라는 수치도 독립적인 측정 결과가 아니라 OpenAI가 내놓은 자체 데이터다. 컨텍스트 길이 제한이 얼마인지, 실제 동시 접속 환경에서 처리량이 어떻게 유지되는지에 대한 언급도 없는데, 사실 웨이퍼 스케일 시스템은 예전부터 이런 부분에서 좀 까다로웠다. 프리뷰 외부의 고객들이 직접 검증된 수치를 내놓기 전까지는 일단 '데모용 최대치' 정도로만 생각하는 게 좋다.
만약 이 모드가 지금 성능 그대로 정식 출시된다면, 가장 큰 수혜자는 지연 시간 때문에 제품 출시를 미뤄왔던 에이전트 및 인터랙티브 서비스 개발팀들일 거다. 그리고 당연히 Cerebras도 큰 이득을 보겠지. 여전히 대부분의 추론 예산이 당연하게 가정하는 Nvidia 기본값에 맞서, 이제 OpenAI라는 확실한 레퍼런스를 확보하게 됐으니까.

