시간선: 무엇이, 언제 일어났는가
시야를 더 넓히면 그림이 선명해집니다. 7월 30일 OpenAI는 가장 저렴한 티어(GPT-5.6 Luna) 요금을 80% 내렸고, 8월 6–7일에는 Luna를 무료 기본값으로 두고 텍스트 대화를 무제한으로 열었습니다. 중국 랩이 요금을 올리고 플래그십 가중치를 개방하는 바로 그 시점에, 미국 랩은 소비자 계층에서 가격을 깎고 무료로 가고 있었습니다. 우연이 아닙니다. 같은 가격 전쟁의 양쪽 면입니다.
| 날짜 | 사건 |
|---|---|
| 2026년 7월 16일 | Moonshot AI가 Kimi K3(2.8T 파라미터)를 오픈웨이트로 공개, 미국 안보 심사를 부름 |
| 2026년 8월 2–3일 | 알리바바가 Qwen3.8-Max를 프리뷰한 뒤 호스팅 API로 출시 |
| 2026년 8월 10일 | Meta가 Muse Glimmer(30B, Apache 2.0)를 공개하고 플래그십 Muse Spark 1.2의 오픈웨이트를 예고 |
| 2026년 8월 12일 | 알리바바가 Qwen3.8-2.4T-A95B 오픈웨이트를 Hugging Face/ModelScope에 게시; xAI가 Grok 4.6을 출시 |
| 2026년 8월 13일 | DeepSeek-V4-Pro가 GA에 들어가고 8월 17일 발효 인상을 발표; Google이 할인된 Gemini 3.7 Flash를 출시 |
| 2026년 8월 14일 | Zhipu가 GLM-5.2의 743B 베이스를 재사용한 GLM-5.3을 출시 |
| 2026년 8월 17일 베이징 시간 00:00 | DeepSeek 신규 요금이 적용됨 |
헤드라인 비율은 과금 항목을 섞습니다: 「11x」, 「1,100% 초과」, 「350%」는 모두 맞습니다. 각각 캐시 히트 입력, 출력, 캐시 미스 입력에 대응합니다.
오픈웨이트가 Apache 2.0은 아닙니다: Qwen3.8-Max는 대형 상업 이용자에 대한 가격 결정력을 남기는 커스텀 라이선스를 씁니다.
같은 베이스, 큰 도약: GLM-5.3은 파운데이션 모델을 재학습하지 않았습니다. 확대한 사후학습 RL이 일을 했습니다.
「중국 모델 = 가장 싸다」가 깨지고 있습니다: DeepSeek 비피크는 여전히 Claude Opus 5보다 낮지만, 무조건 가장 싼 선택은 더 이상 아닙니다.
한 달, 두 개의 퍼널: 중국 랩은 플래그십을 오픈웨이트로 풀고 구간 요금을 올립니다. 미국 랩은 소비자 계층에서 무료와 저가로 갑니다.
수치: DeepSeek 구간, Qwen3.8 사양, GLM-5.3 점수
DeepSeek의 새 요금표는 8월 17일 베이징 시간 00:00에 적용됐습니다. 피크 시간은 베이징 시간 오전 9시–12시, 오후 2시–6시입니다. 헤드라인의 「1,100%」는 피크 시간 캐시 히트 입력 요금에만 해당합니다. 이 구간은 원래 공짜에 가장 가까웠습니다. 실제 청구에서 더 큰 비중을 차지하는 출력 요금은 350% 올랐습니다.
| 과금 항목 (1M 토큰당) | 기존 요금 | 신규 비피크 | 신규 피크 | 피크 인상폭 |
|---|---|---|---|---|
| V4-Flash 캐시 히트 (입력) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash 캐시 미스 (입력) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash 출력 | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro 캐시 히트 (입력) | ¥0.025 | ¥0.15 | ¥0.30 | ~1,100% |
| V4-Pro 캐시 미스 (입력) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro 출력 | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Qwen3.8-2.4T-A95B는 알리바바가 Max급(플래그십) 모델을 오픈웨이트로 공개한 첫 사례입니다. Qwen3.5/3.6/3.7 Max는 API 전용으로 남았습니다.
| 사양 | 내용 |
|---|---|
| 파라미터 | 총 2.4T, 토큰당 활성 95B (MoE, 전문가 512개, 라우팅 10 + 공유 1) |
| 컨텍스트 창 | 네이티브 262,144 토큰(오픈 체크포인트), 약 1.01M까지 확장 가능; 호스팅 Max 버전 기본값은 1M |
| 공개 일정 | 8월 2일 프리뷰 → 8월 3일 API 가동 → 8월 12일 오픈웨이트 |
| API 요금 (국제) | 입력 $2/M, 출력 $6/M |
| 라이선스 | Apache 2.0이 아님 — 커스텀 「Qwen3.8-Max License」 |
이 GLM 수치는 Zhipu가 자체 보고한 점수이며, 독립 제3자 재측정은 아직 공개되지 않았습니다. GLM-5.3은 Terminal-Bench 3.0에서 GPT-5.6 Sol(34.6%)과 Claude Fable 5(33.7%)에 뒤집니다. 오픈웨이트 상위권이지만 프론티어 단독 승리는 아닙니다.
| 벤치마크 | GLM-5.2 | GLM-5.3 | 변화 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
독립 비용 모델링에 따르면, 현실적인 고사용 워크로드(월 약 84M 토큰, 대부분 비피크, 캐시 히트 절반)의 청구 증가는 1.8배에 가깝습니다. 인상은 분명하지만, 가장 자극적인 헤드라인 숫자보다는 훨씬 낮습니다.
세 가지 전략: DeepSeek, 알리바바, Zhipu
DeepSeek: 정액에서 시간대별 요금으로 — 전략 전환이 아니라 용량 문제입니다. 가장 쉬운 오독은 「중국에서 가장 싸던 모델이 결국 마진 압력에 굴복했다」입니다. 구조를 보면 오히려 반대에 가깝습니다. 컴퓨트 제약을 요금표에 처음으로 드러낸 회사에 가깝습니다. DeepSeek의 예전 정액·상시 저가는 GPU 용량이 수요를 따라가는 동안 고객 확보 도구로 작동했습니다. 사용량이 지수적으로 늘고 용량이 따라가지 못하면 무언가를 명시해야 합니다. 공식 발표의 「더 유연한 워크로드 스케줄링을 권장」은 「피크 시간 컴퓨트가 이제 부족하니, 부하를 직접 옮겨 달라」는 기업식 표현입니다.
국제 보도가 거의 놓친 세부입니다. 피크 시간에는 DeepSeek 공식 API 요금이 GMI Cloud, Novita 등 여러 제3자 리셀러보다 높아졌습니다. 이들 리셀러는 현재 V4 Pro를 DeepSeek의 새 피크 요금보다 낮게 게시합니다. 「공식 API가 DeepSeek를 돌리는 가장 싼 길」이라는 평판의 핵심이 처음으로 깨졌습니다.
알리바바: 오픈웨이트는 생태계 호의를 사고, 커스텀 라이선스는 매출 상한을 지킵니다. Qwen3.8-Max의 오픈웨이트는 단순한 관용이 아닙니다. 알리바바는 동시에 두 가지를 했습니다. 2.4T 파라미터 체크포인트 전체를 무료 다운로드로 공개했고, 소형 Qwen에 쓰던 허용적 Apache 2.0이 아닌 커스텀 라이선스를 붙였습니다. 「Model-as-a-Service」 또는 「AI Work Assistant」 사업이 연속 12개월 중 $50 million을 넘기면 별도 상업 라이선스를 협상해야 하고, 월간 활성 사용자 1억 명 이상 또는 월 매출 $20M 이상 제품은 모델명을 눈에 띄게 표시해야 합니다.
논리입니다. 가중치를 풀어 개발자 마인드셰어를 가져가되(특히 「중국산 모델」에 기업 구매자가 아직 주저하는 해외에서), 그 위에 경쟁 추론 사업을 세울 수 있는 소수 기업에 대한 가격 결정력은 남깁니다. Meta의 Muse Glimmer는 제한 없는 Apache 2.0으로 나옵니다. 「오픈웨이트」가 두 공개에서 같은 뜻은 아닙니다.
온라인에 떠돈 소문 하나를 분명히 끊습니다. 알리바바 라이선스가 미국, EU, 영국, 한국의 다운로드를 금지한다는 주장입니다. 사실이 아닙니다. 공개된 라이선스 본문에는 지리적·영토 조항이 전혀 없습니다. 공개 주기가 이처럼 빠를 때는 발표 스레드가 아니라 LICENSE 파일을 확인하는 데 몇 초면 충분하고, 이미 반박된 주장을 반복하지 않을 수 있습니다.
GLM-5.3: 새 베이스가 아니라 더 큰 사후학습 베팅 — 그것이 본론입니다. GLM-5.3에서 가장 흥미로운 사실은 점수가 아니라 방법입니다. GLM-5.2와 같은 743B 파라미터 베이스, 재학습 없음, Terminal-Bench 3.0에서 대략 6배(4.6% → 28.3%) 상승이 전부 사후학습 강화 학습 환경 확대에서 나왔습니다. 사전학습 스케일링 법칙의 수익 체감이 드러나는 동안, 사후학습 RL 스케일이 독립 성능 레버가 되고 있으며 새 파운데이션 모델을 다시 학습하는 것보다 비용 하한이 훨씬 낮다는 업계 추세를 확인합니다. 진입 장벽이 의미 있게 낮아지고, OpenAI급 컴퓨트 예산이 없는 중위 랩도 에이전트·코딩 벤치마크 격차를 좁힐 수 있는 이유입니다.
참고: 제3자 재측정이 나오기 전까지 GLM 점수는 벤더 자체 보고로 취급합니다. Terminal-Bench 3.0 28.3%는 오픈웨이트 상위 기록이지만, GPT-5.6 Sol이나 Claude Fable 5를 넘는 프론티어 승리는 아닙니다.
DeepSeek는 여전히 가장 싼 프론티어급 모델인가
위안-달러 환산은 약 ¥7.15/$1, 근사치입니다. 짧은 답: 아닙니다. 인상을 반영해도 DeepSeek V4-Pro 비피크 요금은 Claude Opus 5보다 여전히 훨씬 낮습니다. 다만 테이블에서 무조건 가장 싼 선택은 더 이상 아닙니다. Qwen3.8-Max 국제 요금과 OpenAI Luna 모두 DeepSeek 비피크를 밑돕니다. 「중국 모델 = 가장 싼 모델」은 2025년과 2026년 초에는 대체로 맞았습니다. 이제는 안전한 가정이 아닙니다.
| 모델 | 입력 (1M 토큰당) | 출력 (1M 토큰당) | 오픈웨이트? |
|---|---|---|---|
| DeepSeek V4-Pro (피크) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | 아니오 |
| DeepSeek V4-Pro (비피크) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | 아니오 |
| Qwen3.8-Max (국제 API) | $2.00 | $6.00 | 예 (커스텀 라이선스) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | 아니오 |
| Claude Opus 5 (암시, 알리바바 자체 비교 비율) | ~$5.00 | ~$25.00 | 아니오 |
더 큰 틀에 놓으면 패턴이 보입니다. 지난 한 달 남짓, 중국 상위 랩은 국내 금융 매체가 「一周三更」(일주일에 모델 업데이트 세 번)이라 부르기 시작한 속도로 대형 공개를 이어 갔습니다. DeepSeek, 알리바바, Zhipu에 더해 그 앞의 Moonshot Kimi K3(7월 16일 오픈웨이트, 2.8T 파라미터)와 MiniMax H3가 있습니다. 중국 보도는 대체로 중국 오픈웨이트 공개가 「AI 산업의 글로벌 재가격을 강제한다」고 프레이밍합니다.
한편 미국 랩은 소비자 계층에서 반대 수를 둡니다. OpenAI는 가장 싼 티어를 80% 인하(7월 30일)한 뒤 일주일 만에 해당 모델을 전원에게 무료·무제한으로 열었습니다(8월 6–7일). Google은 세 주 된 직전작의 절반 가격으로 코딩 특화 모델을 냈습니다(8월 13일). 중국 랩이 플래그십을 오픈웨이트로 풀고 컴퓨트가 부족한 상단에 구간별·더 높은 요금을 도입하는 동안, 미국 랩은 소비자 끝에서 무료와 저가로 달립니다. 둘 다 실제 전략이며, 퍼널의 다른 구간을 최적화합니다.
지정학적 층도 조심스럽게 이름을 붙일 만합니다. Moonshot의 7월 Kimi K3 오픈웨이트는 이미 미국 안보 심사를 불렀고, 알리바바가 이 창에 2.4T 플래그십을 개방한 것을 일부 분석가는 규제 강화 가능성 전에 국제 마인드셰어와 「기술 동등」 서사를 고정하려는 수로 읽습니다. 확인된 사실이 아니라 정보에 기반한 해석입니다. 다만 영어권 테크 언론만 읽으면 놓치기 쉬운 맥락입니다. 그 보도는 대체로 이번 공개를 국가 단위 패턴이 아니라 개별 제품 뉴스로 다뤘습니다.
쟁점, 청구서 6단계 점검, 인용 가능한 수치 세 가지
「1,100%」 헤드라인은 기술적으로 맞지만, 맥락 없이는 오도합니다. 적용 대상은 피크 시간 캐시 히트 입력뿐이며, 원래 0에 가장 가깝던 구간입니다. 대부분의 실제 청구를 지배하는 출력 요금은 350% 올랐습니다. 매체마다 다른 구간을 전체인 것처럼 인용했습니다.
Qwen3.8-Max가 알리바바 자체 Zhenwu M890 칩에서 돈다는 주장(여러 중국 금융 매체가 완전 국산 실리콘 추론 스택의 증거로 보도)은 알리바바 자체 기술 문서나 제3자 벤치마크로 독립 확인되지 않았습니다. 확인될 때까지 벤더 인접, 미검증 보도로 취급합니다.
GLM-5.3이 Cursor에서 「심각한 취약점」을 발견했다는 보고는 VentureBeat 보도와 Zhipu 자체 공개에 근거합니다. 취약점의 구체적 기술 세부는 공개되지 않았으므로, 이 주장은 벤더 출처이며 독립 감사를 거치지 않은 보안 발견으로 읽어야 합니다.
중국 상무부가 AI/반도체 기술에 대한 보복 수출통제를 준비 중일 수 있다는 보도는 추측이며, 공식 발표가 아닌 미확인 매체 보도에 근거합니다. 확정 사실이 아니라 배경 맥락으로 취급합니다.
주의: 재공개 전에 최신 공식 요금과 라이선스 조건을 확인합니다. 위에서 미검증으로 표시한 세부(국산 칩 주장, Cursor 취약점 보고, 수출통제 소문)는 독립 확인되지 않았습니다.
과금 항목을 나눕니다: 「1,100%」를 청구서 전체에 적용하지 않습니다. 캐시 히트 입력, 캐시 미스 입력, 출력의 기존 대 신규 요금을 따로 기록합니다.
트래픽을 베이징 피크 창에 맞춥니다: 피크는 베이징 시간 오전 9시–12시, 오후 2시–6시이며 비피크는 피크의 절반입니다. 많은 팀에서 모델을 바꾸는 것보다 부하를 옮기는 쪽이 청구를 더 바꿉니다.
캐시 히트율을 측정합니다: 캐시 히트 입력은 절대액으로 여전히 쌉니다. 고사용 청구를 지배하는 것은 캐시 미스 입력과 출력입니다.
공식 피크와 리셀러를 비교합니다: GMI Cloud, Novita 등은 여전히 DeepSeek 공식 피크를 밑돌 수 있습니다. 「공식이 항상 가장 싸다」는 더 이상 성립하지 않습니다.
자체 호스팅 전에 Qwen 라이선스를 읽습니다: 개인·내부 이용은 대체로 영향이 없습니다. 연속 12개월 중 $50M을 넘는 MaaS 또는 AI Work Assistant 사업은 별도 상업 라이선스가 필요합니다. 1억+ MAU 또는 월 매출 $20M+ 제품은 모델명을 표시해야 합니다. 지리적 금지는 없습니다.
평가와 24/7 에이전트를 비피크로 옮길 수 있는 노드에 둡니다: 노트북은 절전하고 네트워크가 끊깁니다. 격리 평가, 사후학습 실험, iOS CI는 고객센터에서 시작합니다.
V4-Pro 피크 캐시 히트 입력 ¥0.30 / 1M 토큰: ¥0.025에서 올랐으며 약 1,100%입니다. 헤드라인 숫자가 여기서 나옵니다.
Qwen3.8-2.4T-A95B: 총 2.4T, 활성 95B, 네이티브 컨텍스트 262K; 국제 API는 백만 토큰당 입력 $2 / 출력 $6입니다.
GLM-5.3 Terminal-Bench 3.0: 같은 743B 베이스에서 재학습 없이 4.6% → 28.3%(+23.7 pts); 여전히 GPT-5.6 Sol 34.6%, Claude Fable 5 33.7%보다 낮습니다.
약한 대안은 쉽게 이름을 붙일 수 있습니다. 헤드라인 배수로 이전하면 비피크·고캐시 이용자의 청구를 과장합니다. Qwen 가중치를 Apache 2.0으로 취급하면 대형 상업 배포가 걸립니다. 절전 노트북에서 24/7 평가와 에이전트를 돌리면 네트워크와 권한 한계에 부딪힙니다. iOS CI/CD와 AI Agent 자동화에 맞는 더 안정적인 프로덕션 환경이라면 KVMNODE Mac Mini 클라우드 임대가 대개 더 나은 선택입니다. 전용 Apple Silicon, sudo 개방, 다지역 노드, 일/주/월 단위. 요금과 주문 페이지를 확인하세요.
기준일: 2026년 8월 17일. 출처: DeepSeek 공식 요금 발표, Wall Street CN, IT Home, AIGC.cn, V2EX와 교차 확인; 알리바바 공식 Qwen 저장소(Hugging Face / ModelScope)와 라이선스 조건에 관한 South China Morning Post 보도; Zhipu(Z.ai) GLM-5.3 기술 페이지, VentureBeat, StableLearn; Meta AI Research 공식 블로그와 Muse Glimmer에 관한 VentureBeat; 중국 오픈웨이트 공개 속도에 관한 Yicai, Sohu Finance.