DeepSeek V4 풀버전이란? 프리뷰판에서 GA 정식판까지 타임라인
3개월의 대기 끝에 DeepSeek V4 풀버전(GA 정식판)이 2026년 7월 20일 정식 출시되었습니다. 올해 4월 프리뷰판과 비교해 성능이 전면 강화되었을 뿐 아니라, 최초로 피크/오프피크 과금이 도입되어 DeepSeek이 「거의 무료」에서 규율 있는 상용 운영으로 전환했음을 보여줍니다.
| 시점 | 이벤트 |
|---|---|
| 2026년 4월 24일 | V4 프리뷰판 출시 + OSS(MIT), V4-Pro(1.6T)·V4-Flash(284B) 포함 |
| 2026년 5월 | V4-Flash/V4-Pro 프로덕션 튜닝판 출시, API 가용 |
| 2026년 6월 | V4-Pro 가격 영구 75% 인하(출력 $0.87/M tokens) |
| 2026년 6월 29일 | 전체 API 사용자에 이메일, 7월 중순 GA·피크/오프피크 과금 최초 공개 |
| 2026년 7월 19일 | 다수 개발자 GA 그레이 테스트 자격, 언론 「풀버전 내일 출시 가능」 보도 |
| 2026년 7월 20일 | GA 정식판 출시(본문 게시일) |
| 2026년 7월 24일 | 구 인터페이스명 deepseek-chat·deepseek-reasoner 영구 중단 |
한 줄 요약: V4 프리뷰판도 이미 강력했지만, 풀버전은 Agent·수학 추론·코드 생성을 추가 강화하고 정식 상용 과금 체계를 갖췄습니다. 기반 MoE 아키텍처는 동일하며, GA 업그레이드는 안정성·최적화·상용 가격 구조에 집중합니다.
마이그레이션 기한 간과: deepseek-chat을 계속 쓰는 코드는 7월 24일 23:59(베이징 시간) 이후 영구 실효됩니다.
피크 시간대 무분별 호출: 평일 09:00–12:00, 14:00–18:00 요금 2배. 배치 작업을 오프피크로 돌리지 않으면 청구가 급증합니다.
Pro/Flash 미분류: 단순 라우팅에 V4-Pro를 쓰면 Flash(출력 $0.28/M)로 가능한 경량 작업을 낭비합니다.
캐시 히트 무시: Prompt Cache 미구축 시 Flash 캐시 히트 $0.0028/M 극저비용을 놓칩니다.
벤치마크 오독: SWE-bench Verified 80.6%는 OSS 최고이나 SWE-bench Pro에서는 Claude Fable 5(80.3%)가 여전히 선두——단일 랭킹으로 프로덕션 선정하지 마세요.
DeepSeek V4 Pro·Flash 아키텍처 심층: CSA, HCA, mHC, Muon
DeepSeek V4는 3가지 핵심 아키텍처 혁신으로 1M token 컨텍스트에서 KV Cache 메모리를 V3.2의 10%(V4-Flash 7%)까지 줄여 초장 컨텍스트를 경제적으로 실현합니다.
| 사양 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조(1.6T) | 2840억(284B) |
| Token당 활성 파라미터 | 490억(49B) | 130억(13B) |
| Transformer 레이어 | 61층 | 43층 |
| 컨텍스트 윈도우 | 1,000,000 tokens | 1,000,000 tokens |
| 최대 출력 | 384K tokens | 384K tokens |
| 정밀도 | FP4(전문가 가중치)+FP8(기타) | FP4+FP8 혼합 |
| 사전학습 데이터 | 33T+ tokens | 32T+ tokens |
| OSS 라이선스 | MIT | MIT |
하이브리드 어텐션(CSA + HCA)
DeepSeek V4는 V2/V3 시대 Multi-head Latent Attention(MLA)을 버리고 두 가지 신규 어텐션 메커니즘을 결합합니다.
Compressed Sparse Attention: KV 시퀀스를 Softmax 게이트 풀링으로 4배 압축. FP4 「라이트닝 인덱서」로 top-k 희소 선택(Pro top-1024, Flash top-512). 최근 128 token 슬라이딩 윈도우 유지. 1M 컨텍스트 추론 FLOPs는 V3.2의 27%만.
Heavily Compressed Attention: token을 128배 압축 후 글로벌 밀집 어텐션으로 장거리 의존성 포착. CSA와 상보. V4-Flash는 앞 2층 HCA, 이후 CSA/HCA 교대. V4-Pro도 유사 구조.
Manifold-Constrained Hyper-Connections(mHC)와 Muon 옵티마이저
mHC는 기존 잔차 연결을 강화해 4채널 잔차 스트림을 도입합니다. 이중확률 행렬 제약(Birkhoff 다면체)을 만족하는 혼합 행렬로 61층 깊은 네트워크에서도 신호를 안정 전파합니다. Muon 옵티마이저(AdamW 대체)는 뉴턴-슐츠 직교화로 그래디언트를 처리해 수렴을 가속하고 학습을 안정화합니다.
| 추론 모드 | 특징 | 적용 시나리오 |
|---|---|---|
| Non-think | 사고 체인 없음, 초고속 응답 | 단순 Q&A, 라우팅 |
| Think High | 명시적 추론(thinking 태그) | 중간 복잡도, 코드 디버깅 |
| Think Max | 최대 추론 강도, 384K+ 컨텍스트 필요 | 복잡 수학, 긴 체인 Agent |
공식 권장 샘플링: temperature=1.0, top_p=1.0(전 모드 공통).
DeepSeek V4 벤치마크: SWE-bench Verified 80.6%와 가성비 비교
| 벤치마크 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(OSS 최고) | 96.0% | 별도 미공개 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified는 실제 GitHub 저장소 Bug 수정을 측정하며, 80.6%는 현재 OSS 모델 최고점으로 Gemini 3.1 Pro와 동률입니다. SWE-bench Pro는 더 엄격하며 Claude Fable 5의 80.3%가 현재 선두입니다.
Artificial Analysis 평가: Claude Fable 5는 Strategy & Ops 지수 작업 1회 $3.48(50점), DeepSeek V4-Pro 동종 작업 $0.03(38점)——비용은 Fable 5의 116배, 점수 차는 약 12점.
| 차원 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| OSS/셀프호스트 | MIT OSS | 폐쇄형 | 폐쇄형 |
| 컨텍스트 | 1M tokens | 미공개 | 1M tokens |
| API 출력(오프피크) | $0.87/M | ~$15/M | $50/M |
| 피크 출력 | $1.74/M | — | — |
| 코드 능력 | 매우 강함(Fable 5 근접) | 매우 강함 | 최강(SWE-bench Pro) |
| 데이터 프라이버시 | 프라이빗 배포 가능 | 불가 | 불가 |
시나리오 선정: 예산 제한/고빈도 호출/프라이빗 배포 → V4-Pro 또는 V4-Flash; 극한 코드 능력·비용 무관 → Claude Fable 5; 복잡 알고리즘+수학 추론 → GPT-5.6 Sol/Ultra; 초대규모 로그/문서 처리 → V4-Flash(캐시 히트 입력 $0.0028/M).
DeepSeek V4 피크/오프피크 과금 상세와 API 마이그레이션 6단계
GA판 최대 관심사는 DeepSeek 최초의 피크/오프피크 차등 요금입니다. 전력 시간대 요금과 유사합니다. 피크 시간(베이징): 평일 09:00–12:00, 14:00–18:00, 요금 2배.
| 모델 | 과금 항목 | 오프피크 | 피크 |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | ¥0.025 / $0.0035 / 1M | 2배 |
| V4-Pro | 입력(캐시 미스) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 |
| V4-Pro | 출력 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 |
| V4-Flash | 입력(캐시 히트) | ¥0.02 / $0.0028 / 1M | 2배 |
| V4-Flash | 입력(캐시 미스) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 |
| V4-Flash | 출력 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
절감 4전략: ① 비실시간 작업을 오프피크(18:00 이후 또는 09:00 이전)로 배치; ② Prompt Cache로 캐시 히트율 향상; ③ Flash로 분류, 복잡 추론은 Pro로; ④ DeepSeek 과금 변경 24시간 전 이메일 확인. 피크에도 V4-Pro 출력 $1.74/M는 Claude Opus 4.8($15/M)보다 8.6배 저렴합니다.
중요: 구 모델명 deepseek-chat·deepseek-reasoner는 2026년 7월 24일 15:59 UTC(베이징 7월 24일 23:59)에 영구 중단됩니다.
| 구 모델명 | 신 모델명 | 비고 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(비사고 모드) | 고속, 경량 작업 |
deepseek-reasoner | deepseek-v4-flash(사고 모드) | 또는 deepseek-v4-pro로 업그레이드 |
API 마이그레이션 6단계:
전체 저장소 검색: 코드베이스에서 deepseek-chat·deepseek-reasoner 전체 참조를 검색합니다.
매핑 교체: 경량 채팅 → deepseek-v4-flash; 구 추론 모드 → Flash 사고 모드 또는 deepseek-v4-pro.
OpenAI SDK 업데이트: model만 변경, base_url은 https://api.deepseek.com 유지.
사고 모드 활성화(선택): extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}로 구 reasoner 동작 대체.
Anthropic SDK 호환: V4는 OpenAI ChatCompletions·Anthropic Messages 형식 모두 지원. model만 갱신하면 됩니다.
Staging 검증: 7월 24일 전 테스트 환경 전량 회귀 완료, 구 모델명 호출 잔존 없음 확인.
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)DeepSeek V4 풀버전 업그레이드 가치? 인용 가능 데이터와 결론
DeepSeek V4 GA 정식판은 2026년 OSS LLM 분야 최중요 마일스톤 중 하나입니다. 가치는 Claude Fable 5·GPT-5.6을 이기는 것(아직은 아님)이 아니라, 폐쇄형 플래그십 1/10~1/100 비용으로 OSS 모델 중 최강 성능을 제공하는 데 있습니다.
80.6%/OSS 1위: SWE-bench Verified OSS 최고, Gemini 3.1 Pro와 동률.
10%/7%: 1M token 시나리오 KV Cache 메모리 V3.2의 10%(Flash 7%).
$0.03/116배: V4-Pro Strategy & Ops 1회 $0.03, Fable 5 $3.48——116배 가격차, 24% 성능차.
데이터 해외 반출을 원치 않는 기업, 예산 제한 독립 개발자, 1M token 장컨텍스트 Agent 엔지니어, 극한 가성비 AI 제품팀에게 DeepSeek V4 Pro는 현재 약점이 적은 선택입니다. 피크/오프피크 과금은 비용 복잡도를 높이지만 본질적으로 여전히 매우 경쟁력 있습니다——「가격 파괴자」에서 「규칙 있는 상용 플랫폼」으로의 전환은 성숙 신호입니다.
대안 정리: 개인 Mac만으로 DeepSeek Agent 부하 테스트 시 슬립·네트워크 변동으로 장컨텍스트 작업이 중단되기 쉽습니다. 폐쇄형 API만 의존하면 V4 MIT OSS+$0.87/M 출력 가격의 비용·데이터 주권 면에서 열세입니다. 7월 24일 마이그레이션 기한 무시 시 프로덕션 하드 중단됩니다. iOS CI/CD, DeepSeek V4 Agent 7×24 자동화, 로컬 ds4 추론 검증이 필요한 프로덕션 환경에서는 KVMNODE 전용 Mac Mini M4 클라우드 대여가 통상 더 나은 선택입니다. Apple Silicon 통합 메모리, sudo 개방, 일/주/월 유연 주문. 자세히 가격 페이지, 고객 센터, 바로 주문을 참고하세요.
데이터 기준: 2026년 7월 20일 · 출처: DeepSeek 공식 문서, arXiv:2606.19348, HuggingFace, Artificial Analysis