ChatGPT나 Claude를 자주 사용하다 보면 이런 생각이 들 수 있습니다.
월 구독료를 계속 내느니, AWS EC2에 Qwen 같은 오픈소스 모델을 올려 직접 운영하는 것이 더 저렴하지 않을까?
작은 모델이라면 충분히 가능한 이야기입니다.
하지만 목표가 단순한 7B 또는 14B급 챗봇이 아니라, Claude Fable이나 최신 ChatGPT에 가까운 체감 성능이라면 필요한 모델과 GPU 규모가 완전히 달라집니다.
이번 글에서는 Claude Fable과 동일한 모델을 복제한다고 가정하지 않습니다. Claude의 정확한 파라미터와 구조가 공개되지 않았기 때문입니다.
대신 공개 모델 가운데 상위권 성능을 목표로 할 수 있는 Qwen3-235B-A22B를 Claude Fable급 자체 운영 모델의 현실적인 대리 기준으로 사용해보겠습니다.

먼저 전제부터 명확히 하자
Claude Fable의 정확한 파라미터 수와 모델 구조는 공개되지 않았습니다.
따라서 Qwen3-235B-A22B가 Claude Fable과 완전히 같은 성능을 낸다고 단정할 수는 없습니다.
이번 비교에서 의미하는 것은 다음과 같습니다.
Claude Fable급의 모든 기능과 성능을 복제하는 것이 아니라, 최신 상위권 오픈소스 모델을 직접 운영해 비슷한 수준의 고난도 추론·코딩·에이전트 작업을 시도하는 경우다.
Qwen3-235B-A22B는 총 2350억 개의 파라미터를 가진 MoE 모델입니다. 한 번에 모든 파라미터를 연산하지 않고, 토큰당 약 220억 개의 파라미터만 활성화합니다. 공식 모델 카드에 따르면 128개의 전문가 중 토큰마다 8개가 선택됩니다.
| 구분 | Qwen3-235B-A22B |
| 전체 파라미터 | 235B |
| 활성 파라미터 | 22B |
| 전문가 수 | 128개 |
| 토큰당 활성 전문가 | 8개 |
| 구조 | Mixture of Experts |
| 기본 컨텍스트 | 최대 262K급 |
Qwen 측은 이 모델이 코딩, 수학, 일반 능력 등의 벤치마크에서 DeepSeek-R1, OpenAI o1·o3-mini, Gemini 2.5 Pro 등과 경쟁 가능한 성능을 보였다고 설명합니다. 다만 벤치마크 경쟁력이 곧 Claude Fable과 동일한 실제 사용자 경험을 의미하는 것은 아닙니다.
기존의 g6.xlarge로는 실행할 수 있을까?
AWS g6.xlarge에는 NVIDIA L4 GPU 한 장이 탑재되며 GPU 메모리는 24GB입니다. G6 인스턴스는 L4 기반 추론용 인스턴스입니다.
Qwen3-235B 모델의 가중치 용량을 단순 계산하면 다음과 같습니다.
| 정밀도 | 이론적 가중치 용량 |
| BF16·FP16 | 약 470GB |
| INT8·FP8 | 약 235GB |
| INT4 | 약 117.5GB |
계산 방식은 간단합니다.
BF16: 2350억 × 2바이트 ≈ 470GB
INT8: 2350억 × 1바이트 ≈ 235GB
INT4: 2350억 × 0.5바이트 ≈ 117.5GB
여기에 KV Cache, CUDA 실행 공간, 추론 엔진, 텐서 병렬화 오버헤드가 추가됩니다.
따라서 GPU 메모리가 24GB인 g6.xlarge 한 대에는 Qwen3-235B를 올릴 수 없습니다.
g6.xlarge GPU 메모리: 24GB
Qwen3-235B INT4 가중치: 약 117.5GB
최소 약 5배의 메모리 차이
CPU 메모리로 일부 가중치를 넘기는 오프로딩을 사용할 수는 있지만, 응답 속도가 크게 느려지므로 Claude나 ChatGPT처럼 사용하는 서비스 환경과는 거리가 멉니다.
최소 구성: g6e.24xlarge와 INT4 모델
Qwen3-235B를 가장 저렴하게 운영하려면 4비트 양자화를 사용하는 방안을 생각할 수 있습니다.
AWS g6e.24xlarge에는 NVIDIA L40S GPU 4개가 들어가며, GPU당 약 48GB, 전체 GPU 메모리는 약 192GB입니다.
AWS 사양표에서는 실제 사용 가능한 메모리가 GPU당 약 44GiB, 총 약 178GiB로 표시됩니다.
| 항목 | g6e.24xlarge |
| GPU | NVIDIA L40S 4개 |
| 총 GPU 메모리 | 명목상 192GB |
| vCPU | 96개 |
| 시스템 메모리 | 768GiB |
| 미국 버지니아 온디맨드 | 시간당 약 15.07달러 |
2026년 7월 기준 미국 버지니아 리전의 g6e.24xlarge 온디맨드 가격은 시간당 약 15.0656달러로 조회됩니다.
INT4로 양자화한 Qwen3-235B 가중치는 약 117.5GB입니다.
192GB급 GPU 메모리라면 가중치를 올리고 남은 공간을 KV Cache와 실행 메모리에 사용할 수 있습니다.
총 GPU 메모리: 약 192GB
INT4 가중치: 약 117.5GB
이론적 잔여 공간: 약 74.5GB
따라서 단일 사용자 또는 낮은 동시 접속, 제한된 컨텍스트 길이를 전제로 하면 g6e.24xlarge가 최소한의 실험 구성으로 볼 수 있습니다.
다만 4비트 양자화는 메모리를 크게 줄여주지만, 항상 BF16과 동일한 품질이나 처리량을 보장하지는 않습니다. 양자화 방식과 추론 엔진에 따라 품질 저하와 런타임 오버헤드가 발생할 수 있습니다. 4비트 가중치 기반 추론은 비용을 줄일 수 있지만, 구현에 따라 역양자화 오버헤드가 커질 수 있다는 연구 결과도 있습니다.
g6e.24xlarge의 실제 월 비용
시간당 15.0656달러로 계산해보겠습니다.
| 운영 방식 | 월 사용시간 | 월 EC2 비용 |
| 하루 2시간 | 60시간 | 약 904달러 |
| 평일 하루 8시간 | 160시간 | 약 2,411달러 |
| 매일 하루 8시간 | 240시간 | 약 3,616달러 |
| 24시간 상시 운영 | 730시간 | 약 10,998달러 |
계산식은 다음과 같습니다.
하루 2시간:
15.0656 × 60시간 = 약 904달러
평일 하루 8시간:
15.0656 × 160시간 = 약 2,411달러
매일 하루 8시간:
15.0656 × 240시간 = 약 3,616달러
24시간 상시 운영:
15.0656 × 730시간 = 약 10,998달러
여기에는 다음 비용이 포함되지 않았습니다.
- EBS 모델 저장공간
- 스냅샷
- 데이터 전송
- 로드밸런서
- 모니터링
- 장애 대비 인스턴스
- 추론 서버 운영
- 모델 업데이트
- 엔지니어 인건비
즉, 최소 구성으로 하루 2시간만 사용해도 월 약 900달러입니다.
조금 더 안정적인 구성: g6e.48xlarge
AWS g6e.48xlarge에는 L40S GPU 8개와 총 384GB GPU 메모리가 제공됩니다. AWS는 G6e 계열에서 최대 8개의 L40S, 384GB GPU 메모리, 400Gbps 네트워크를 제공합니다.
| 항목 | g6e.48xlarge |
| GPU | NVIDIA L40S 8개 |
| 총 GPU 메모리 | 384GB |
| vCPU | 192개 |
| 시스템 메모리 | 1.5TiB |
| 미국 버지니아 온디맨드 | 시간당 약 30.13달러 |
미국 버지니아 리전의 온디맨드 가격은 시간당 약 30.1312달러입니다.
이 구성에서는 Qwen3-235B를 INT8이나 FP8에 가까운 약 235GB 규모로 올리는 방안을 고려할 수 있습니다.
총 GPU 메모리: 384GB
8비트 가중치: 약 235GB
이론적 잔여 공간: 약 149GB
4비트 모델을 사용하면 KV Cache와 동시 처리 공간을 더 확보할 수 있습니다.
따라서 g6e.48xlarge는 다음과 같은 경우에 적합합니다.
- 더 긴 컨텍스트 사용
- 여러 사용자 요청 처리
- 더 큰 KV Cache 확보
- 양자화 품질을 조금 더 높이고 싶은 경우
- 추론 서버를 내부 서비스로 운영하는 경우
월 비용은 다음과 같습니다.
| 운영 방식 | 월 사용시간 | 월 EC2 비용 |
| 하루 2시간 | 60시간 | 약 1,808달러 |
| 평일 하루 8시간 | 160시간 | 약 4,821달러 |
| 매일 하루 8시간 | 240시간 | 약 7,231달러 |
| 24시간 상시 운영 | 730시간 | 약 21,996달러 |
즉, 상시 운영하면 한 달 약 2만2000달러입니다.
품질 중심 구성: p5.48xlarge
양자화로 인한 품질 저하를 줄이고 BF16 또는 FP16에 가까운 상태로 모델을 운영하려면 H100 GPU가 탑재된 P5 계열을 고려할 수 있습니다.
AWS p5.48xlarge에는 NVIDIA H100 GPU 8개가 들어갑니다. 총 GPU 메모리는 640GB입니다. AWS는 P5 인스턴스에 최대 8개의 H100을 제공한다고 설명합니다.
Qwen3-235B의 BF16 가중치는 약 470GB입니다.
H100 총 GPU 메모리: 640GB
Qwen3-235B BF16 가중치: 약 470GB
이론적 잔여 공간: 약 170GB
따라서 p5.48xlarge는 BF16에 가까운 정밀도로 모델을 올릴 수 있는 현실적인 단일 인스턴스 구성입니다.
다만 컨텍스트 길이와 동시 사용자 수를 늘리면 KV Cache가 커지므로 640GB 역시 무한한 용량은 아닙니다.
2026년 7월 현재 미국 동부 리전의 p5.48xlarge 가격은 출처와 구매 방식에 따라 차이가 있습니다. 온디맨드 조회에서는 시간당 약 55.04달러 수준이 확인되며, Capacity Block은 시점과 리전에 따라 더 낮거나 다른 가격이 적용될 수 있습니다.
시간당 55.04달러를 기준으로 계산하면 다음과 같습니다.
| 운영 방식 | 월 사용시간 | 월 EC2 비용 |
| 하루 2시간 | 60시간 | 약 3,302달러 |
| 평일 하루 8시간 | 160시간 | 약 8,806달러 |
| 매일 하루 8시간 | 240시간 | 약 13,210달러 |
| 24시간 상시 운영 | 730시간 | 약 40,179달러 |
상시 운영하면 월 약 4만 달러입니다.
세 가지 구성을 비교해보자
| 구성 | GPU | 모델 정밀도 예시 | 시간당 비용 | 24시간 월 비용 |
| g6.xlarge | L4 24GB × 1 | 실행 불가 | 약 0.8달러 | 약 588달러 |
| g6e.24xlarge | L40S × 4, 약 192GB | INT4 | 약 15.07달러 | 약 10,998달러 |
| g6e.48xlarge | L40S × 8, 384GB | INT8 또는 INT4 | 약 30.13달러 | 약 21,996달러 |
| p5.48xlarge | H100 × 8, 640GB | BF16·FP16 | 약 55.04달러 | 약 40,179달러 |
기존에 생각했던 시간당 0.8달러짜리 g6.xlarge와 비교하면 최소 구성인 g6e.24xlarge도 약 19배 비쌉니다.
15.0656 ÷ 0.8048 ≈ 18.7배
품질 중심의 P5 구성은 시간당 비용만 약 68배 차이입니다.
55.04 ÷ 0.8048 ≈ 68.4배
그런데 Qwen3-235B가 정말 Claude Fable과 같을까?
그렇지는 않습니다.
Qwen3-235B가 높은 수준의 공개 모델인 것은 맞지만, Claude Fable과 동일한 서비스 경험을 만들려면 모델 가중치만 올려서는 부족합니다.
상용 AI 서비스에는 모델 외에도 다음과 같은 시스템이 붙습니다.
- 시스템 프롬프트와 정책 모델
- 웹 검색
- 코드 실행
- 파일 분석
- 이미지와 문서 이해
- 도구 호출
- 에이전트 루프
- 컨텍스트 압축
- 메모리 관리
- 프롬프트 캐싱
- 안전 필터
- 모델 라우팅
- 추론 시간 조절
- 실패 시 재시도와 검증
특히 Claude Fable은 모델 자체 성능뿐 아니라 스프레드시트, 문서, 코딩, 도구 사용을 연결하는 서비스 하네스의 영향을 크게 받습니다. Anthropic은 Fable이 이전 Opus 모델보다 일부 일상적 스프레드시트 작업을 더 적은 단계와 빠른 시간으로 완료한다고 설명합니다.
따라서 Qwen3-235B를 AWS에 배포하는 것만으로 Claude Fable과 동일한 품질이 나오지는 않습니다.
다음과 같은 추가 구성이 필요합니다.
Qwen3-235B-A22B
+ vLLM 또는 TensorRT-LLM
+ RAG
+ 웹 검색
+ 코드 실행 샌드박스
+ 도구 호출
+ 에이전트 루프
+ 안전 필터
+ 출력 검증
+ 프롬프트 캐싱
+ 모니터링
vLLM의 PagedAttention과 같은 기술은 KV Cache 낭비를 줄이고 동일한 GPU에서 처리량을 높일 수 있습니다. 관련 연구에서는 기존 추론 시스템 대비 처리량을 2~4배 높인 결과를 보고했습니다.
하지만 처리량이 개선된다고 해서 모델 자체의 지식과 추론 성능이 Claude와 같아지는 것은 아닙니다.
구독 비용과 직접 운영 비용의 차이
개인용 ChatGPT나 Claude 구독은 일반적으로 월 수십 달러부터 시작합니다.
반면 Qwen3-235B를 직접 운영하면 최소 구성도 다음 정도입니다.
하루 2시간:
약 904달러
평일 업무시간:
약 2,411달러
24시간 운영:
약 10,998달러
즉, 월 20달러 구독과 최소 자체 운영 환경을 비교하면 다음과 같습니다.
904달러 ÷ 20달러 ≈ 45배
24시간 운영은 다음과 같습니다.
10,998달러 ÷ 20달러 ≈ 550배
그마저도 Claude Fable과 동일한 서비스가 아니라 Qwen3-235B 모델을 직접 운영하는 비용입니다.
서비스 개발과 운영 인력을 포함하면 차이는 더 커집니다.
자체 운영이 의미 있는 경우
그렇다고 자체 LLM 운영이 의미 없다는 것은 아닙니다.
민감한 데이터를 외부로 보낼 수 없는 경우
개인정보, 소스코드, 보안 로그, 내부 기밀문서가 외부 AI 서비스로 전송되면 안 되는 환경이라면 자체 모델 운영이 필요할 수 있습니다.
모델과 추론 환경을 완전히 통제해야 하는 경우
가중치, 양자화, 시스템 프롬프트, 가드레일, 로그, 필터링 정책을 직접 통제해야 한다면 자체 운영의 가치가 있습니다.
사용량이 매우 많은 경우
매우 많은 사용자가 지속적으로 모델을 사용해 GPU 이용률을 높게 유지할 수 있다면 건당 추론 비용이 낮아질 수 있습니다.
반대로 하루에 몇 번 질문하는 정도라면 GPU 대부분이 유휴 상태가 되므로 경제성이 매우 낮습니다.
보안 연구와 실습이 목적인 경우
프롬프트 인젝션, 탈옥, RAG 데이터 오염, 모델 공급망, 에이전트 권한 관리 등을 연구하려면 모델 환경을 직접 제어하는 것이 유리합니다.
개인 연구용이라면 어떤 구성이 현실적일까?
개인 또는 소규모 연구 환경에서 반드시 Qwen3-235B를 사용할 필요는 없습니다.
일반적으로는 다음과 같이 나누는 것이 현실적입니다.
| 목적 | 추천 모델 규모 | AWS 구성 예시 |
| 간단한 RAG·분류 | 7B~14B | g6.xlarge |
| 보안 분석·코딩 실습 | 14B~32B | g6e.xlarge |
| 고품질 단일 사용자 추론 | 70B급 | 다중 L40S 또는 고용량 GPU |
| 상위권 오픈 모델 서비스 | 235B MoE | g6e.24xlarge 이상 |
| BF16 품질 중심 운영 | 235B MoE | p5.48xlarge급 |
특정 업무에 집중한다면 32B 모델에 RAG와 도구 호출을 붙여 더 큰 범용 모델과 경쟁하는 편이 비용 효율적일 수 있습니다.
예를 들어 보안 분석용이라면 다음과 같은 구성이 가능합니다.
Qwen 32B
+ 보안 지침 RAG
+ CVE 검색 도구
+ 로그 분석 코드 실행
+ 결과 검증 규칙
+ 반복 평가 루프
이 구성은 Claude Fable과 같은 범용 모델은 아니지만, 특정 보안 업무에서는 충분히 좋은 결과를 만들 수 있습니다.
결론
Claude Fable급 체감 성능을 목표로 공개 Qwen 모델을 직접 운영한다면, 현실적인 비교 대상은 7B나 14B가 아니라 Qwen3-235B-A22B급 모델입니다.
이 모델은 총 235B 파라미터를 가지며, 토큰당 약 22B 파라미터가 활성화되는 MoE 구조입니다.
가장 저렴한 현실적 구성은 Qwen3-235B를 INT4로 양자화해 g6e.24xlarge에서 실행하는 것입니다.
그러나 비용은 시간당 약 15달러입니다.
- 하루 2시간: 월 약 904달러
- 평일 하루 8시간: 월 약 2,411달러
- 24시간 운영: 월 약 10,998달러
조금 더 안정적인 g6e.48xlarge는 월 약 2만2000달러, BF16 품질을 노리는 p5.48xlarge는 월 약 4만 달러가 필요할 수 있습니다.
따라서 일반적인 개인이나 1인 기업이라면 ChatGPT 또는 Claude 구독이 압도적으로 경제적입니다.
Qwen 자체 운영은 구독료를 절약하기 위한 선택이 아니라, 데이터 통제권과 모델 통제권을 확보하기 위한 선택이다.
현실적으로는 일반적인 추론·코딩·문서 작업에는 Claude와 ChatGPT를 사용하고, 민감한 데이터나 보안 연구에는 14B~32B 자체 모델을 사용하는 하이브리드 구성이 가장 합리적입니다.
참고 자료
- Qwen3 공식 소개
https://qwenlm.github.io/blog/qwen3/ - Qwen3-235B-A22B 공식 모델 카드
https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507 - Qwen3 기술 보고서
https://arxiv.org/abs/2505.09388 - AWS EC2 G6 인스턴스
https://aws.amazon.com/ec2/instance-types/g6/ - AWS EC2 G6e 인스턴스
https://aws.amazon.com/ec2/instance-types/g6e/ - AWS EC2 P5 인스턴스
https://aws.amazon.com/ec2/instance-types/p5/ - AWS 온디맨드 가격 정책
https://aws.amazon.com/ec2/pricing/on-demand/ - vLLM PagedAttention 연구
https://arxiv.org/abs/2309.06180 - QServe 4비트 추론 최적화 연구
https://arxiv.org/abs/2405.04532
'일반IT > AI' 카테고리의 다른 글
| LLM은 어떻게 배우고 답하는가 — 대규모 언어 모델의 학습과 추론 과정 (0) | 2026.07.22 |
|---|---|
| 생성형 AI는 갑자기 나타난 기술이 아니다 — AI 역사와 분류로 이해하는 기존 머신러닝과의 차이 (1) | 2026.07.22 |
| 보안 프롬프트 엔지니어링: 페르소나, 스킬, 하네스, 루프 엔지니어링의 이해 (1) | 2026.07.21 |
| 생성형 AI 보안을 위한 3중 방어선: KISA·개보위·국정원 가이드라인 다운로드 및 비교 (0) | 2026.07.17 |
| AI 프롬프트는 한 번 정하면 끝일까? 고정된 프롬프트보다 반복 검증이 중요한 이유 (1) | 2026.07.17 |