더 똑똑한 챗봇이 아니라 ‘업무를 끝내는 AI’로의 진화
OpenA(OpenAI)출시했습니다.
흔히 ‘ChatGPT 5.6’이라고 부르지만, 정확히 말하면 ChatGPT라는 서비스에 GPT-5.6 모델이 새롭게 적용된 것입니다.
GPT-5.6은 제한된 프리뷰 기간을 거쳐 ChatGPT, Codex, OpenAI API에 정식으로 제공되기 시작했습니다. OpenAI는 이번 모델을 단순히 답변 품질이 향상된 언어 모델이 아니라, 코딩·지식 업무·사이버 보안·과학 연구·컴퓨터 사용과 같은 복잡한 작업을 수행하기 위한 모델로 설명하고 있습니다.

GPT-5.6은 다음 세 가지 모델로 구성됩니다.
| 모델 | 주요 역할 | 특징 |
| GPT-5.6 Sol | 플래그십 모델 | 복잡한 추론과 고난도 업무 |
| GPT-5.6 Terra | 균형형 모델 | 성능·속도·비용의 균형 |
| GPT-5.6 Luna | 경량·고속 모델 | 빠른 처리와 낮은 비용 |
Sol은 GPT-5.6 제품군에서 가장 강력한 모델입니다. 복잡한 코딩, 전문 지식 업무, 과학 연구, 사이버 보안과 같이 긴 추론이 필요한 작업에 적합합니다.
Terra는 GPT-5.5와 경쟁할 수 있는 성능을 제공하면서도 비용을 낮춘 균형형 모델이며, Luna는 속도와 비용 효율성을 우선한 모델입니다.
OpenAI는 앞으로 숫자는 모델 세대를 나타내고, Sol·Terra·Luna는 성능과 비용에 따른 지속적인 모델 계층으로 운영할 계획이라고 설명했습니다.
GPT-5.6의 핵심은 무조건 더 많은 토큰을 사용해 답을 길게 생성하는 것이 아닙니다.
OpenAI가 강조하는 부분은 같은 비용과 토큰으로 더 많은 일을 성공적으로 수행하는 능력입니다.
GPT-5.6은 이전 모델보다 적은 출력 토큰과 도구 호출만으로 복잡한 작업을 처리하도록 설계되었습니다. 코드를 작성하는 것에서 끝나는 것이 아니라 다음과 같은 작업 흐름을 지속적으로 수행하는 방향으로 발전했습니다.
- 요구사항과 자료 분석
- 작업 계획 수립
- 필요한 도구 호출
- 코드 또는 문서 작성
- 실행 결과 확인
- 오류 수정
- 최종 산출물 생성
즉, GPT-5.6은 대화형 챗봇보다는 작업의 시작부터 결과물 완성까지 담당하는 AI 작업자에 가까워지고 있습니다.
API 개발자에게 주목할 만한 기능은 Programmatic Tool Calling입니다.
기존의 에이전트는 모델이 도구를 한 번 호출하고, 결과를 전달받은 다음 다시 판단하는 과정을 반복했습니다. 도구 호출 횟수가 많아질수록 토큰 사용량과 지연 시간도 증가했습니다.
GPT-5.6은 Responses API에서 메모리 내부의 프로그램을 작성하고 실행해 여러 도구를 조정할 수 있습니다. 중간 결과를 프로그램으로 처리한 뒤 필요한 내용만 다시 모델에 전달할 수 있어 복잡한 에이전트 작업의 효율성을 높일 수 있습니다.
OpenAI는 이 기능이 Zero Data Retention 환경과도 호환된다고 설명합니다. (OpenAI) 방식이 다음과 같았다면,
모델 → 검색 도구 호출
모델 → 검색 결과 분석
모델 → 데이터베이스 호출
모델 → 데이터 분석
모델 → 보고서 생성
Programmatic Tool Calling에서는 다음과 같이 중간 작업을 프로그램이 조정할 수 있습니다.
모델 → 작업 프로그램 생성
→ 검색 및 데이터 조회
→ 결과 필터링과 계산
→ 핵심 결과만 모델에 전달
모델 → 최종 보고서 생성
에이전트를 운영하는 기업 입장에서는 모델의 단일 응답 성능만큼이나 전체 작업에 사용되는 토큰, 도구 호출 횟수와 완료 시간이 중요해졌다는 의미입니다.
max와 ultra 추론 모드
GPT-5.6에는 복잡한 작업을 위한 추론 수준도 추가되었습니다.
max는 하나의 모델이 더 많은 추론 자원을 사용하도록 하는 설정입니다. 반면 ultra는 여러 하위 에이전트가 병렬로 작업하고 결과를 통합하는 멀티에이전트 방식입니다.
예를 들어 복잡한 기술 조사라면 다음과 같이 역할을 분리할 수 있습니다.
에이전트 1: 공식 문서 조사
에이전트 2: 코드와 구현 방법 검증
에이전트 3: 보안 위험 분석
에이전트 4: 비용과 운영 방식 분석
메인 에이전트: 전체 결과 검증 및 보고서 작성
다만 ultra는 일반적인 짧은 질문에 사용하기보다는 여러 자료와 도구를 동시에 다뤄야 하는 복합 업무에 적합합니다. ChatGPT Work에서는 일부 상위 요금제에, Codex에서는 Plus 이상 요금제에 제공됩니다.
GPT-5.6 Sol은 OpenAI가 발표한 평가에서 코딩과 터미널 기반 작업 성능이 향상되었습니다.
대표적인 결과는 다음과 같습니다.
| 평가 항목 | GPT-5.5 | GPT-5.6 Sol | GPT-5.6 Sol Ultra |
| Terminal-Bench 2.1 | 85.6% | 88.8% | 91.9% |
| DeepSWE 1.1 | 67.0% | 72.7% | - |
| Coding Agent Index | 76.4 | 80.0 | - |
Terminal-Bench는 단순한 코드 생성이 아니라 터미널을 사용해 계획하고, 명령을 실행하고, 오류를 수정하는 복합 작업을 평가합니다.
따라서 이번 개선은 “알고리즘 문제를 더 잘 푼다”는 의미보다 실제 개발 환경에서 더 오랫동안 작업을 유지할 수 있게 됐다는 의미가 큽니다.
다만 일부 코딩 벤치마크에서는 경쟁 모델이 더 높은 점수를 기록하고 있습니다. 특정 평가 점수만 보고 모든 개발 업무에서 GPT-5.6이 가장 우수하다고 단정해서는 안 됩니다.
GPT-5.6은 코드뿐만 아니라 업무용 산출물 생성에도 초점을 맞추고 있습니다.
OpenAI에 따르면 GPT-5.6은 기존 문서와 프레젠테이션에 적용된 레이아웃, 글꼴, 간격, 색상과 반복되는 디자인 규칙을 분석해 새로운 결과물에도 일관되게 적용할 수 있습니다.
특히 다음과 같은 작업이 강화되었습니다.
- 참조 프레젠테이션의 디자인을 반영한 신규 슬라이드 제작
- 수정 가능한 프레젠테이션 생성
- 복잡한 스프레드시트와 재무 모델 작성
- 기존 문서 형식을 유지하면서 내용 업데이트
- 프런트엔드 화면을 생성하고 렌더링 결과까지 확인
- 시각적 문제와 기능 오류를 직접 수정
이는 생성형 AI의 경쟁 기준이 텍스트 답변에서 실제로 제출하거나 공유할 수 있는 결과물의 완성도로 이동하고 있다는 것을 보여줍니다.
GPT-5.6은 웹 브라우저나 데스크톱 환경을 조작하는 컴퓨터 사용 능력도 향상되었습니다.
| 평가 항목 | GPT-5.5 | GPT-5.6 Sol |
| OSWorld 2.0 | 47.5% | 62.6% |
| BrowseComp | 84.4% | 90.4% |
| BrowseComp Ultra | 84.4% | 92.2% |
OSWorld는 실제 운영체제와 애플리케이션을 조작하는 능력을 평가하며, BrowseComp는 여러 웹페이지를 탐색하고 필요한 정보를 찾는 에이전트형 웹 작업을 평가합니다.
모델이 화면을 보고 버튼을 누르는 것만으로는 충분하지 않습니다. 작업의 현재 상태를 이해하고, 잘못된 결과를 감지하고, 다음 행동을 결정해야 합니다.
GPT-5.6의 개선은 ChatGPT가 정보를 알려주는 서비스에서 점차 사용자를 대신해 소프트웨어를 조작하는 서비스로 이동하고 있음을 보여줍니다.
GPT-5.6에서 특히 주목할 부분은 사이버 보안 능력입니다.
OpenAI가 공개한 평가 결과는 다음과 같습니다.
| 평가 항목 | GPT-5.5 | GPT-5.6 Sol |
| Capture-the-Flag | 88.1% | 96.7% |
| SEC-Bench Pro | 45.8% | 71.2% |
| ExploitBench | 47.9% | 73.5% |
| ExploitGym | 15.1% | 33.7% |
GPT-5.6은 보안 코드 리뷰, 취약점 분석, 패치 작성, 위협 모델링, 블루팀 업무와 같은 방어적 작업에서 활용될 수 있습니다.
그러나 모델의 보안 능력이 향상되면 공격에 악용될 가능성도 함께 증가합니다. OpenAI는 GPT-5.6을 사이버 보안 및 생물·화학 영역에서 High capability로 분류했습니다. 다만 현재 평가에서는 가장 높은 위험 단계인 Critical에는 도달하지 않았다고 밝혔습니다.
GPT-5.6에는 이전 모델보다 강한 보안 통제가 적용되었습니다.
OpenAI는 GPT-5.6 Sol의 사이버 보안 안전장치가 이전 모델보다 잠재적으로 위험한 활동을 약 10배 더 많이 차단하도록 보수적으로 설정됐다고 설명했습니다.
이 때문에 정상적인 취약점 분석, 보안 교육 또는 악성코드 분석 요청도 일부 제한될 수 있습니다. OpenAI는 정상적인 요청이 차단됐을 때 낮은 성능의 모델로 다시 시도할 수 있는 기능도 제공할 계획입니다. OpenAI에서는 GPT-5.6이 GPT-5.5보다 사용자의 의도를 넘어 요청하지 않은 행동을 시도하는 경향이 더 높게 관찰됐다고 밝혔습니다. 절대적인 발생률은 낮지만, 도구와 시스템 권한을 사용하는 에이전트에서는 주의해야 할 부분입니다. (OpenAI Deployment Safety Hub) GPT-5.6 기반 에이전트를 운영한다면 모델의 안전 정책에만 의존해서는 안 됩니다.
사용자 요청
↓
정책 및 권한 검사
↓
GPT-5.6 에이전트
↓
승인된 도구만 호출
↓
중요 작업은 사용자 승인
↓
실행 로그 및 결과 검증
최소 권한, 실행 환경 격리, 도구별 허용 목록, 중요 작업 승인, 호출 로그 기록과 지속적인 보안 평가가 함께 적용돼야 합니다.
OpenAI 역시 공식 발표에서 완전한 보안은 존재하지 않으며, 새로운 모델이 출시될 때마다 새로운 우회와 공격 가능성이 발견될 것이라고 명시했습니다. (OpenAI)ChatGPT에서는 어떻게 사용할 수 있을까?
GPT-5.6이 출시됐다고 해서 모든 ChatGPT 대화가 즉시 GPT-5.6으로 처리되는 것은 아닙니다.
일상적인 빠른 질문에는 여전히 GPT-5.5 Instant가 기본 모델로 사용됩니다. 복잡한 요청에 추론 옵션을 선택하면 GPT-5.6 Sol이 사용됩니다.
ChatGPT에서 표시되는 옵션은 다음과 같습니다.
| 옵션 | 사용 모델 |
| Instant | GPT-5.5 Instant |
| Medium | GPT-5.6 Sol |
| High | GPT-5.6 Sol |
| Extra High | GPT-5.6 Sol |
| Pro | GPT-5.6 Sol Pro |
제공되는 옵션은 사용 중인 요금제와 기업 워크스페이스 설정에 따라 달라집니다. Plus 사용자는 Medium과 High를 이용할 수 있으며, 상위 요금제에서는 Extra High 또는 Sol Pro와 같은 추가 옵션이 제공됩니다.
GPT-5.6은 순차적으로 배포되고 있으므로 대상 요금제를 사용하더라도 모델 선택 화면에 바로 나타나지 않을 수 있습니다. (OpenAI Help Center)API 가격
GPT-5.6 API의 100만 토큰당 가격은 다음과 같습니다.
| 모델 | 입력 토큰 | 출력 토큰 |
| GPT-5.6 Sol | 5달러 | 30달러 |
| GPT-5.6 Terra | 2.5달러 | 15달러 |
| GPT-5.6 Luna | 1달러 | 6달러 |
모델 단가만 보면 Sol이 가장 비싸지만, 실제 운영 비용은 단순한 토큰 단가로만 판단하기 어렵습니다.
성능이 낮은 모델이 작업을 여러 번 실패하거나 더 많은 도구 호출과 출력 토큰을 사용한다면 전체 비용은 오히려 증가할 수 있습니다.
따라서 API 모델을 선택할 때는 다음 항목을 함께 측정해야 합니다.
전체 비용 =
입력 토큰 비용
+ 출력 토큰 비용
+ 도구 실행 비용
+ 재시도 비용
+ 작업 실패 처리 비용
GPT-5.6부터는 프롬프트 캐시 쓰기에 일반 입력 요금의 1.25배가 적용되고, 캐시 읽기에는 기존과 같이 90% 할인이 적용됩니다. 명시적인 캐시 구분점과 최소 30분의 캐시 유지 시간도 지원됩니다.
GPT-5.6의 등장으로 모델 평가 기준도 달라져야 합니다.
이제는 단순히 정답률이나 응답 속도만 비교해서는 부족합니다.
1. 실제 작업 완료율
모델이 답변을 생성했는지가 아니라 최종 작업을 정상적으로 완료했는지 측정해야 합니다.
2. 전체 토큰과 도구 호출 비용
한 번의 응답 가격이 아니라 작업 전체에 소비된 토큰, API 호출과 재시도 비용을 계산해야 합니다.
3. 장기 작업의 안정성
작업 시간이 길어져도 초기 목적과 제약 조건을 유지하는지 확인해야 합니다.
4. 권한을 벗어난 행동
에이전트가 요청하지 않은 파일 수정, 명령 실행 또는 외부 전송을 시도하지 않는지 평가해야 합니다.
5. 보안 정책의 일관성
언어, 역할, 문맥과 출력 형식을 변경했을 때도 동일한 보안 정책이 유지되는지 반복적으로 검증해야 합니다.
GPT-5.6처럼 에이전트 기능이 강한 모델은 기존의 질의응답 평가보다 실험적인 시나리오와 지속적인 Threat Hunting 방식의 평가가 더욱 중요합니다.
마무리
GPT-5.6은 단순히 GPT-5.5보다 답변을 조금 더 잘하는 모델이 아닙니다.
이번 출시에서 가장 중요한 변화는 다음 세 가지입니다.
- 첫째, Sol·Terra·Luna로 모델을 구분해 업무 난이도와 비용에 맞게 선택할 수 있게 됐습니다.
- 둘째, Programmatic Tool Calling과 멀티에이전트 기능을 통해 복잡한 업무를 더 적은 토큰과 도구 호출로 처리할 수 있게 됐습니다.
- 셋째, 코드와 텍스트를 생성하는 수준을 넘어 문서, 프레젠테이션, 스프레드시트와 애플리케이션 같은 최종 결과물을 완성하는 방향으로 발전했습니다.
결국 GPT-5.6이 보여주는 변화는 명확합니다.
생성형 AI의 경쟁이 ‘누가 더 좋은 답변을 만드는가’에서
‘누가 실제 업무를 더 정확하고 안전하게 끝내는가’로 이동하고 있습니다.
다만 에이전트의 능력이 높아질수록 잘못된 판단 하나가 실제 시스템 변경이나 정보 유출로 이어질 가능성도 커집니다.
따라서 GPT-5.6은 강력한 모델인 동시에, 권한 통제·실행 검증·모니터링·지속적인 보안 평가가 반드시 필요한 모델이라고 볼 수 있습니다.
'일반IT > AI' 카테고리의 다른 글
| 임베딩 벡터를 역분석하면 원문이 그대로 복원될까? (1) | 2026.07.13 |
|---|---|
| ChatGPT에 펫이 생겼다? OpenAI Pets 기능과 커스텀 펫 만드는 방법 (1) | 2026.07.10 |
| LLM 보안 진단은 왜 정형화된 패턴만으로 부족할까? (0) | 2026.07.09 |
| LLM 파라미터는 왜 필요할까? (0) | 2026.07.09 |
| 프롬프트 인젝션은 “질문”이 아니라 “업무 지시처럼 보이게 만드는 기술”이다 (0) | 2026.07.06 |