오픈AI, 차세대 모델 'GPT-5.6' 공개…미 정부 요청으로 '제한적 프리뷰'부터 시작

오픈AI가 차세대 추론 모델 'GPT-5.6' 시리즈를 전격 공개했다. 코딩과 생명과학, 사이버보안 등 핵심 지표에서 역대 최고 성능을 기록했지만, 미국 정부의 요청에 따라 일반 공개 대신 소수의 신뢰 파트너를 대상으로 한 제한적 프리뷰부터 시작하며 업계의 이목을 끌고 있다.
오픈AI는 지난 6월 26일(현지시간) 공식 블로그를 통해 GPT-5.6 제품군을 발표했다. 이번 라인업은 최상위 플래그십 모델 '솔(Sol)', 일상 업무에 최적화된 균형형 모델 '테라(Terra)', 그리고 속도와 비용 효율을 극대화한 경량 모델 '루나(Luna)' 등 3종으로 구성됐다. 태양과 지구, 달을 뜻하는 이름을 통해 각 모델의 위상과 역할을 직관적으로 드러냈다는 평가다.
벤치마크서 '미토스 5' 넘어…코딩·생명과학·보안 전반 강화
성능 지표에서는 파격적인 결과가 나왔다. 복잡한 명령줄 작업 수행 능력을 측정하는 '터미널벤치(Terminal-Bench) 2.1'에서 GPT-5.6 솔은 88.8%를, 다중 하위 에이전트가 동시에 작업하는 '울트라' 모드에서는 91.9%를 각각 기록했다. 이는 그동안 최고 성능으로 꼽혀온 앤트로픽의 '클로드 미토스 5'(88%대)를 앞서는 수치다.
생명과학 분야 평가 지표인 '진벤치(GeneBench) v1'에서는 이전 모델인 GPT-5.5보다 더 적은 토큰을 사용하고도 더 강한 분석 성능을 보였다. 유전체학 및 정량 생물학 데이터를 다루는 장기 연구 과제 수행 능력을 검증하는 지표다.
사이버보안 영역에서는 소프트웨어 취약점 탐지와 익스플로잇 코드 작성 능력을 측정하는 '익스플로잇벤치(ExploitBench)'에서, 솔이 출력 토큰을 약 3분의 1만 사용하고도 앤트로픽의 '미토스 프리뷰'와 맞먹는 성능을 보였다. 다만 오픈AI는 크로미움·파이어폭스 환경 테스트에서 솔이 취약점과 익스플로잇 구성 요소는 식별했지만, 완전한 공격 체인을 자율적으로 만들어내는 수준에는 이르지 못해 자체 '사이버 중요도' 기준선은 넘지 않았다고 밝혔다.
가격은 동결...비용 효율은 대폭 개선
가격 정책은 기존 GPT-5.5와 동일한 수준을 유지했다. 100만 토큰 기준으로 솔은 입력 5달러·출력 30달러, 테라는 입력 2.5달러·출력 15달러, 루나는 입력 1달러·출력 6달러로 책정됐다. 오픈AI 측은 테라가 GPT-5.5와 비슷한 성능을 절반 가격에 제공하며, 루나는 역대 가장 저렴한 비용으로 준수한 성능을 낸다고 설명했다. 다음 달에는 반도체 스타트업 세레브라스와 협력해 초당 750토큰의 초고속 추론 속도를 지원하는 솔 버전도 선보일 예정이다.
미 정부 요청으로 '제한적 공개'…모델 통제 새 표준 되나
이번 발표에서 가장 주목받는 대목은 배포 방식이다. 오픈AI는 공개에 앞서 미국 정부와 GPT-5.6의 성능 및 공개 계획을 사전에 공유했으며, 정부의 요청에 따라 정부와 참여 사실이 공유된 신뢰 파트너 약 20개 기관을 대상으로 우선 프리뷰를 시작했다. 일반 개발자와 기업, 챗GPT 이용자를 대상으로 한 전면 공개는 수 주 내에 단계적으로 이뤄질 예정이다.
업계에서는 이러한 제한적 배포 방식이 지난 6월 2일 트럼프 대통령이 서명한 행정명령과 맞닿아 있다고 본다. 해당 행정명령은 연방 기관들이 협력해 신규 고성능 AI 모델의 역량을 벤치마킹하고 평가하는 절차를 마련하도록 요구하고 있으며, 이 절차에는 통상 30일 가량이 소요되는 것으로 알려졌다. 오픈AI는 공식 블로그에서 "이러한 형태의 정부 승인 절차가 장기적인 표준이 되어서는 안 된다"며, 정부와 협력해 향후에는 별도의 제한적 프리뷰 없이도 신모델을 출시할 수 있는 재현 가능한 절차를 구축해 나가겠다는 입장을 밝혔다.
안전장치도 '역대 최강' 수준으로 강화
오픈AI는 GPT-5.6에 자사 모델 가운데 가장 강력한 다층적 안전장치를 적용했다고 강조했다. 고위험 활동과 민감한 사이버 요청, 반복적인 오남용 시도를 걸러내는 실시간 분류기를 도입했으며, 위험 신호가 감지되면 더 큰 추론 모델이 재검토하는 동안 생성을 즉시 중단하는 구조를 갖췄다. 엔비디아 A100급 GPU 70만 시간 이상을 투입한 자동화 레드팀 테스트를 통해 다양한 맥락에서 통하는 '보편적 탈옥' 시도에 대한 방어력도 집중 점검했다. 다만 오픈AI는 이 같은 촘촘한 안전장치로 인해 프리뷰 기간 중 정상적인 요청조차 지연되거나 차단될 수 있다고 안내했다.
경쟁사 앤트로픽도 맞대응…'클로드 페이블 5' 제한 해제
한편 경쟁사인 앤트로픽 역시 비슷한 시기 유사한 정부발 접근 제한을 겪은 바 있다. 앤트로픽이 지난 6월 9일 출시한 최상위 모델 '클로드 페이블 5'와 '클로드 미토스 5'는 미 상무부의 수출통제 조치에 따라 지난 6월 12일 접근이 일시 중단됐다가, 관련 통제가 6월 30일 해제되면서 7월 1일부로 접근이 복원됐다. 오픈AI의 이번 GPT-5.6 제한적 공개와 맞물려, 프런티어 AI 모델을 둘러싼 정부 차원의 통제와 관리가 새로운 국면에 접어들고 있다는 분석이 나온다.
3D프린팅 타임즈 김순희 편집장