타임라인: 닷새 동안 일어난 일
겉으로는 모순입니다. DeepSeek는 일부 구간에서 최대 약 1100% 인상을 알렸고, 같은 주 Alibaba는 한 번도 공개하지 않았던 2.4조 파라미터 플래그십 가중치를 풀었으며, Zhipu는 재학습 없이 코딩 지표를 약 6배 끌어올린 GLM-5.3을 냈습니다. 세 수의 공통점은 더 싸게 파는 경쟁이 아니라, 누가 가격을 정할지를 겨루는 전환입니다.
| 날짜 | 사건 |
|---|---|
| 2026년 7월 16일 | Moonshot AI가 Kimi K3(2.8조 파라미터)를 공개. 이미 미국 안보 관심을 불렀습니다 |
| 8월 2–3일 | Alibaba가 Qwen3.8-Max를 예고한 뒤 호스티드 API를 올렸습니다 |
| 8월 10일 | Meta가 Muse Glimmer(300억, Apache 2.0)를 내고 플래그십 Muse Spark 1.2 가중치 공개를 예고했습니다 |
| 8월 12일 | Alibaba가 Qwen3.8-2.4T-A95B를 Hugging Face / ModelScope에 공개. 같은 날 xAI가 Grok 4.6을 출시했습니다 |
| 8월 13일 | DeepSeek-V4-Pro가 정식 출시되고 8월 17일 인상을 공지. Google은 인하한 Gemini 3.7 Flash를 냈습니다 |
| 8월 14일 | Zhipu가 GLM-5.3을 출시. 베이스는 GLM-5.2와 같은 7430억 파라미터입니다 |
| 8월 17일 0시(베이징 시간) | DeepSeek 신규 요금이 발효됩니다 |
더 넓히면 7월 30일 OpenAI는 최저 구간 GPT-5.6 Luna를 80% 내렸고, 8월 6–7일에는 무료 사용자 기본 모델로 두고 텍스트를 무제한으로 열었습니다. 중국 쪽이 인상과 공개를 더하는 같은 시간에 미국 쪽은 무료와 인하를 더합니다. 우연이 아니라 같은 가격 전쟁의 양면입니다.
핵심 수치
DeepSeek 인상 명세 (8월 17일 0시 발효)
피크는 베이징 시간 9–12시, 14–18시입니다. 아래는 공개 환율로 환산한 100만 tokens당 달러입니다.
| 과금 항목 | 인상 전 | 오프피크(신) | 피크(신) | 피크 상승 |
|---|---|---|---|---|
| V4-Flash 캐시 히트 입력 | $0.0028 | $0.007 | $0.014 | 약 400% |
| V4-Flash 캐시 미스 입력 | $0.14 | $0.21 | $0.42 | 200% |
| V4-Flash 출력 | $0.28 | $0.63 | $1.26 | 350% |
| V4-Pro 캐시 히트 입력 | $0.0035 | $0.021 | $0.042 | 약 1100% |
| V4-Pro 캐시 미스 입력 | $0.42 | $0.63 | $1.26 | 200% |
| V4-Pro 출력 | $0.84 | $1.89 | $3.78 | 350% |
헤드라인 「1100%」는 피크 시간 캐시 히트 입력에만 해당합니다. 실제 청구를 좌우하는 출력은 350%입니다. 제3자 시산에 따르면 월 약 8400만 tokens, 주로 오프피크, 히트율 절반 정도의 고사용 부하는 청구 증가가 약 1.8배에 가깝습니다.
Qwen3.8-2.4T-A95B 핵심 사양
Alibaba가 Max급(플래그십)을 공개한 것은 처음입니다. Qwen3.5 / 3.6 / 3.7 Max는 API만 제공했습니다.
GLM-5.3 vs GLM-5.2: 같은 베이스, 후훈련만
| 벤치마크 | GLM-5.2 | GLM-5.3 | 변화 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 |
| CyberGym | 77.2% | 84.5% | +7.3 |
| AutomationBench | 26.2% | 48.2% | +22.0 |
수치는 Zhipu 자체 측정이며 독립 재측정은 아직 없습니다. Terminal-Bench 3.0에서는 GPT-5.6 Sol(34.6%)과 Claude Fable 5(33.7%)에 뒤집니다. 전면 1위가 아니라 오픈웨이트 1군입니다.
피크 API 밖에, 통제 가능한 로컬 환경
로컬 평가, Agent, macOS 툴체인을 Root/sudo가 있는 전용 물리 Apple Silicon 노드에서 돌리려면 RUVCLOUD 사용 사례와 일 단위 임대를 먼저 확인하면 됩니다.
세 가지 전략
DeepSeek: 단일 저가에서 시간대별 요금으로. 본질은 용량 부족입니다
「가장 싼 모델이 마진을 챙기러 왔다」는 읽기는 쉽습니다. 요금표 구조를 보면 계산 제약을 가격에 처음 드러낸 움직임에 가깝습니다. 예전 단일 저가는 GPU가 수요를 따라잡는 동안 획득 도구로 작동했습니다. 호출이 지수적으로 늘고 공급이 못 따라가자, 공고의 「더 유연한 워크로드 스케줄링을 권장한다」는 「피크 연산이 부족하니 부하를 옮겨 달라」는 뜻입니다.
국제 보도가 놓치기 쉬운 점도 있습니다. 피크 공식 API는 GMI Cloud, Novita 등 일부 재판매 현행가보다 높아졌습니다. 「공식이 항상 가장 싸다」는 전제는 처음 깨졌습니다.
Alibaba: 가중치로 생태계를 사고, 맞춤 라이선스로 상한을 지킵니다
Qwen3.8-Max 공개는 단순한 시혜가 아닙니다. 2.4조 파라미터 체크포인트를 무료로 풀면서, 소형 Qwen의 Apache 2.0이 아닌 맞춤 라이선스를 붙였습니다. 연속 12개월 매출 5000만 달러 초과의 「Model-as-a-Service」 또는 「AI Work Assistant」 사업은 별도 상업 허가가 필요하고, 월간 활성 1억 초과 또는 월 매출 2000만 달러 초과 제품은 모델명을 눈에 띄게 표시해야 합니다.
논리는 개발자 마음(특히 해외)을 얻으면서, 위에 추론 사업을 올릴 수 있는 소수 대고객에게는 협상권을 남기는 것입니다. 제한 없는 Apache 2.0의 Muse Glimmer와 「오픈웨이트」의 의미가 다릅니다.
미국·EU·영국·한국 다운로드를 금지한다는 소문은 거짓입니다. 공개 라이선스에 지역 조항은 없습니다. 공지 스레드가 아니라 LICENSE 파일을 읽는 편이 빠릅니다.
GLM-5.3: 새 베이스가 아니라 더 큰 후훈련입니다
점수가 아니라 방법입니다. 베이스는 GLM-5.2와 같은 7430억, 재학습 없음, 후훈련에서 강화학습 환경만 키워 Terminal-Bench 3.0이 4.6%에서 28.3%로 약 6배입니다. 사전학습 한계 수익이 둔화하는 동안 후훈련 RL 규모가 독립 레버가 되었고, 새 기반 모델을 다시 만드는 것보다 문턱이 낮습니다.
비교: 인상 후에도 DeepSeek가 가장 싼 플래그십인가
| 모델 | 입력 (100만 tokens) | 출력 (100만 tokens) | 가중치 공개 |
|---|---|---|---|
| DeepSeek V4-Pro (피크) | $1.26 | $3.78 | 없음 |
| DeepSeek V4-Pro (오프피크) | $0.63 | $1.89 | 없음 |
| Qwen3.8-Max (국제 API) | $2 | $6 | 있음 (맞춤 라이선스) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | 없음 |
| Claude Opus 5 (Alibaba 배수 추산) | 약 $5 | 약 $25 | 없음 |
짧은 답은 아닙니다. 오프피크 V4-Pro는 여전히 Claude Opus 5보다 싸지만, 국제 Qwen3.8-Max와 Luna는 오프피크를 한 축 이상에서 밑돕니다. 「중국 모델 = 최저가」는 2025년과 2026년 초에는 대체로 맞았지만, 더 이상 안전한 가정이 아닙니다.
쟁점과 미검증 항목
- 「1100%」는 기술적으로 맞지만 맥락 없이는 오해입니다. 피크 캐시 히트 입력에만 해당합니다. 실제 청구의 중심인 출력은 350%입니다.
- Qwen3.8-Max가 자체 Zhenwu M890에서 돈다는 보도는 Alibaba 기술 문서나 제3자 벤치로 확인되지 않았습니다. 미검증으로 두십시오.
- GLM-5.3이 Cursor의 심각한 취약점을 발견했다는 주장은 VentureBeat와 Zhipu 측 공개에 의존합니다. 기술 세부사항은 비공개이며 벤더 단독 주장입니다.
- AI/반도체 보복 수출통제가 준비 중이라는 보도는 공식 발표가 아니며 배경 추정으로만 읽으십시오.
왜 중요한가: 동시에 달리는 두 가격 전쟁
지난 한 달 중국 상위 랩은 「일주일에 세 번」으로 불릴 만큼 대형 업데이트를 냈습니다. DeepSeek, Alibaba, Zhipu에 더해 7월 16일 공개된 Kimi K3(2.8조)와 MiniMax H3가 앞섰습니다. 현지 경제지는 「세계 AI 산업에 재가격을 강요한다」고 더 강하게 프레이밍합니다.
미국 쪽은 소비 층에서 반대로 갑니다. OpenAI는 7월 30일 최저 구간을 80% 내린 뒤 일주일 만에 무료·무제한으로 바꿨고, Google은 8월 13일 3주 전 선행작의 절반 가격으로 코딩 모델을 냈습니다. 상단은 시간대별 고가와 플래그십 공개, 하단은 무료와 인하입니다. 둘 다 실제 전략이며 최적화하는 깔때기 위치가 다릅니다.
지정학 층도 있습니다. Kimi K3 공개는 이미 미국 심사 관심을 불렀고, Alibaba가 이 창에 2.4조 플래그십을 연 것은 「규제가 조여지기 전에 국제 존재감과 기술 대등 서사를 고정한다」는 해석이 있습니다. 확정 사실이 아니라 해석입니다. Kimi K3 평가 환경은 이전 샌드박스 탈출 정리를 참고하면 됩니다.
가격·라이선스·벤치는 게재 시점 공개 정보입니다. 재게시 전에 최신 공고를 확인하십시오. 1차 입구는 Hugging Face, ModelScope, 라이선스를 다룬 South China Morning Post입니다.
정리
DeepSeek는 용량 부족을 요금표에 썼고, Alibaba는 플래그십 가중치로 개발자를 얻으면서 대고객 허가를 남겼으며, Zhipu는 후훈련 규모만으로 1군에 들어갔습니다. 질문은 「누가 제일 싼가」에서 「누가 시간대와 허가와 청구를 정하는가」로 바뀌었습니다.
실제 macOS에서 Agent, 로컬 평가, 오프피크 배치를 돌린다면 피크 API와 자체 랙은 같은 표의 두 줄입니다. 전용 물리 Apple Silicon과 완전한 Root/sudo는 요금 페이지에 있고, 일 단위로 임대할 수 있습니다.
더 읽기
자주 묻는 질문
인상 후에도 DeepSeek가 GPT-5.6이나 Claude보다 쌉니까?
오프피크는 Claude Opus 5보다 싸지만 전체 최저가는 아닙니다. GPT-5.6 Luna($0.20 / $1.20)와 국제 Qwen3.8-Max($2 / $6)는 적어도 한 축에서 오프피크를 밑돕니다. 플래그십급으로는 여전히 상대적 저가이지만 무조건 최저가는 아닙니다.
Qwen3.8-Max 공개 가중치를 상업 제품에서 무료로 쓸 수 있습니까?
개인 프로젝트와 사내 사용은 거의 영향이 없습니다. 연속 12개월 매출 5000만 달러 초과의 「Model-as-a-Service」 또는 「AI Work Assistant」 사업만 Alibaba와 별도 상업 허가가 필요합니다. 월간 활성 1억 초과 또는 월 매출 2000만 달러 초과면 모델명 표시도 필요합니다.
미국·EU·영국 사용자는 다운로드가 금지됩니까?
아닙니다. 공개 라이선스에 지역 제한은 없습니다. 제한은 매출 규모에 묶이며 소재지와는 무관합니다.
GLM-5.3과 GLM-5.2의 실제 차이는 무엇입니까?
베이스는 같은 7430억 파라미터입니다. Terminal-Bench 3.0의 약 6배는 후훈련에서 강화학습 환경을 키운 결과이며 베이스 재학습은 없습니다.
Meta는 플래그십도 정말 공개합니까?
아직입니다. Muse Glimmer는 300억 증류 모델입니다. Zuckerberg는 닫혀 있던 Muse Spark 1.2 가중치를 「곧」 내겠다고 했지만 이 글을 쓰는 시점에는 나오지 않았습니다. 의도이지 확정 사실이 아닙니다.