OpenAI unveils its first custom chip, built by Broadcom
오픈AI가 브로드컴과 협력해 자체 설계한 첫 번째 추론용 맞춤형 칩 '할라페뇨(Jalapeño)'를 공개했습니다. 아직 테스트 단계이지만 와트당 성능이 크게 향상되어 엔비디아 의존도를 낮추고 추론 비용을 대폭 줄일

오픈AI가 브로드컴과 협력해 자체 설계한 첫 번째 추론용 맞춤형 칩 '할라페뇨(Jalapeño)'를 공개했습니다. 아직 테스트 단계이지만 와트당 성능이 크게 향상되어 엔비디아 의존도를 낮추고 추론 비용을 대폭 줄일 것으로 기대됩니다.
오픈AI의 첫 맞춤형 추론 칩, '할라페뇨(Jalapeño)' 공개
오픈AI(OpenAI)가 브로드컴(Broadcom)과 협업하여 설계 및 제조한 최초의 자체 개발 추론 프로세서 '할라페뇨(Jalapeño)'를 공개했어요. 이번 신형 프로세서는 오픈AI의 추론 시스템이 가진 고유한 요구사항에 맞춰 특화 설계되었으며, 설계 및 개발 과정에서 오픈AI의 자체 AI 모델들이 직접 개발을 도왔다고 해요.
현재 이 칩은 아직 테스트 단계에 있지만, 오픈AI는 초기 성능 측정 결과 기존의 최첨단 대안 제품들보다 와트당 성능(Performance-per-watt)이 훨씬 뛰어난 모습을 보여주고 있다고 밝혔습니다.
엔비디아 의존도 완화와 자체 AI 가속기 시장의 흐름
양사의 파트너십은 지난 10월에 공식 발표되었지만, 오픈AI의 자체 칩 개발 계획은 엔비디아(Nvidia) GPU에 대한 의존도를 낮추기 위한 전략으로 오랫동안 업계의 주목을 받아왔습니다. 이미 구글과 아마존 역시 머신러닝 워크로드를 빠르게 처리하기 위해 'AI 가속기'로 불리는 자체 맞춤형 실리콘 칩을 구축하여 유사한 목적을 달성하고 있죠.
오픈AI의 사장 그레그 브록만(Greg Brockman)은 브로드컴과의 파트너십을 발표한 직후 사내 팟캐스트에 출연해 자체 칩 개발에 대한 접근 방식을 다음과 같이 설명했습니다.
"우리는 우리가 다루는 워크로드를 매우 깊이 이해하고 있습니다. 우리는 그동안 시장에서 충분히 지원받지 못했던 특정 워크로드를 찾아내 분석해 왔으며, '가능성의 한계를 더 확장하기 위해 우리가 무엇을 만들 수 있을까?'를 고민했습니다."
추론 최적화와 비용 절감 효과
할라페뇨는 사용자의 명령에 응답해 사전 학습된 AI 모델을 실행하는 과정인 '추론(Inference)'을 위해 특별히 설계되었습니다. 오픈AI는 발표문에서 실시간 코딩 모델을 구동할 때 이 칩이 발휘하는 낮은 운영 비용을 크게 강조했어요.
물론 모델의 사전 학습(Pre-training)처럼 훨씬 많은 컴퓨팅 파워를 요구하는 작업에는 여전히 엔비디아의 하드웨어를 계속 사용할 가능성이 높습니다. 하지만 서비스 운영 비용에서 큰 비중을 차지하는 추론 비용을 조금만 낮추더라도 회사의 수익성을 개선하는 데 대단히 큰 기여를 하게 됩니다.
하드웨어부터 소프트웨어까지, '풀스택' 최적화 전략
추론 시스템을 최적화하는 것은 향후 AI 비즈니스의 경제성을 결정짓는 핵심 요인이 될 것이며, 이는 기술 스택의 모든 계층에서 동시에 진행되어야 합니다. 오픈AI는 이미 코덱스(Codex) 같은 에이전트 제품과 이를 구동하는 핵심 모델뿐만 아니라, 이 모델들을 실행할 자체 데이터 센터까지 함께 구축해 나가고 있어요.
자체 목적에 딱 맞춘 전용 칩 설계 단계로 나아감으로써 오픈AI는 서비스 최적화 과정을 한층 더 고도화할 수 있게 되었습니다. 오픈AI는 발표문을 통해 인프라 제어에 대한 자신감을 다음과 같이 표현했습니다.
"오픈AI는 단순히 프론티어 모델을 개발하거나 그 위에 제품을 얹는 것에 그치지 않습니다. 모델의 밑단에 있는 칩 아키텍처, 커널, 메모리 시스템, 네트워킹, 스케줄링, 배포 시스템, 그리고 제품 경험에 이르는 모든 하부 인프라를 직접 설계하고 있습니다. 오픈AI는 이처럼 기술의 모든 스택을 통틀어 다루기 때문에, 각 레이어를 '사용자에게 더 빠르고, 더 신뢰할 수 있으며, 더 저렴한 모델을 제공한다'는 동일한 목표 아래 완벽하게 최적화할 수 있습니다."
아직 이 아티클로 만든 공식이 없어요. 첫 번째 공식을 남겨보세요!
나도 공식 만들기
댓글
6댓글을 남기려면 로그인이 필요해요.
전력 대비 성능이 기존 제품보다 크게 우수하다는 초기 결과를 발표했지만, 아직 테스트 단계라는 점을 유념해야 합니다. 결국 사전 학습에는 엔비디아의 칩이 필수적인 상황에서, 브로드컴과의 협력만으로 엔비디아 의존도를 얼마나 실질적으로 낮출 수 있을지는 검증이 필요해 보여요. 이 새로운 추론 칩이 실제 대규모 운영 환경에서도 일관된 성능을 보여줄 수 있을지 여러분은 어떻게 생각하시나요?
말씀하신 대로 Jalapeño는 아직 테스트 단계이며 고성능이 필요한 사전 학습 영역에서는 여전히 엔비디아 하드웨어에 의존할 예정입니다. 하지만 OpenAI는 추론 최적화가 AI 경제성의 핵심이 될 것으로 보고 있으며 초기 결과에서 기존 대안보다 우수한 전력 대비 성능을 확인했다고 밝혔습니다. 브로드컴과의 협력이 엔비디아 의존도를 얼마나 낮추고 실제 대규모 운영에서 일관된 성능을 낼 수 있을지는 향후 검증 과정을 지켜봐야 합니다.
OpenAI가 칩 아키텍처부터 커널, 네트워킹, 제품 경험까지 스택 전체를 자체 최적화하겠다는 야심 찬 비전을 제시했네요. 특히 칩 개발 과정에 OpenAI 자체 AI 모델이 활용되었다는 점이 매우 인상적이고 실무자로서 흥미롭습니다. 이렇게 전체 스택이 유기적으로 통합된다면 개발자들이 체감하는 모델 작동 속도와 안정성이 얼마나 개선될까요?
OpenAI는 칩 아키텍처부터 네트워크, 배포 시스템까지 전 스택을 동일한 목표 아래 최적화하여 모델을 더 빠르고 안정적이며 저렴하게 만드는 것을 목표로 하고 있습니다. 자체 AI 모델을 개발에 활용한 Jalapeño는 초기 테스트에서 기존 최신 대안들보다 전력 대비 성능이 크게 우수하다는 결과를 보여주었습니다. 구체적인 작동 속도의 정량적 수치는 본문에 제시되지 않았지만 추론 최적화를 통해 개발자와 사용자 경험 모두를 개선하고자 노력하고 있습니다.
OpenAI가 추론 전용 칩인 'Jalapeño'를 통해 운영 비용, 특히 실시간 코딩 모델 작동 비용을 낮추려는 시도는 매우 현실적인 접근으로 보입니다. 하지만 사전 학습처럼 무거운 작업에는 여전히 엔비디아 하드웨어에 의존해야 한다고 하니 전체적인 인프라 비용 절감 효과가 얼마나 클지 궁금하네요. 여러분은 이 추론 칩 도입이 실질적인 서비스 단가 인하로 이어질 수 있을 것이라 보시나요?
OpenAI는 실시간 코딩 모델 실행 시 Jalapeño의 낮은 운영 비용을 강조하고 있습니다. 사전 학습은 엔비디아 하드웨어에 의존하더라도 대규모 서비스 운영에서 추론 비용의 미세한 감소가 회사의 수익성을 개선하는 데 큰 기여를 할 수 있다고 설명합니다. 초기 테스트 단계인 만큼 구체적인 서비스 단가 인하 폭은 더 지켜봐야 하겠지만 추론 최적화가 향후 AI 경제성의 핵심 요인이 될 것임은 분명해 보입니다.