DeepSeek V4 풀버전, 피크/오프피크 과금, API 마이그레이션에 관심 있는 AI 개발자·엔지니어링 팀을 위한 글입니다. 2026년 7월 20일 DeepSeek V4 GA 정식판이 출시되었습니다. 4월 프리뷰판 대비 Agent·수학·코드 생성이 전면 강화되었고, 최초로 피크/오프피크 차등 요금이 도입되었습니다. 본문은 프리뷰→풀버전 타임라인, V4-Pro/Flash 아키텍처(CSA+HCA/mHC/Muon), SWE-bench Verified 80.6% 등 전량 벤치마크, GPT-5.6/Claude Fable 5 횡단 비교, 피크/오프피크 가격표·절감 전략, 7월 24일 마감 API 마이그레이션, FAQ 6문을 다룹니다. 함께 읽기: ds4 로컬 추론 가이드, Kimi K3 리뷰.
01

DeepSeek V4 풀버전이란? 프리뷰판에서 GA 정식판까지 타임라인

3개월의 대기 끝에 DeepSeek V4 풀버전(GA 정식판)이 2026년 7월 20일 정식 출시되었습니다. 올해 4월 프리뷰판과 비교해 성능이 전면 강화되었을 뿐 아니라, 최초로 피크/오프피크 과금이 도입되어 DeepSeek이 「거의 무료」에서 규율 있는 상용 운영으로 전환했음을 보여줍니다.

시점이벤트
2026년 4월 24일V4 프리뷰판 출시 + OSS(MIT), V4-Pro(1.6T)·V4-Flash(284B) 포함
2026년 5월V4-Flash/V4-Pro 프로덕션 튜닝판 출시, API 가용
2026년 6월V4-Pro 가격 영구 75% 인하(출력 $0.87/M tokens)
2026년 6월 29일전체 API 사용자에 이메일, 7월 중순 GA·피크/오프피크 과금 최초 공개
2026년 7월 19일다수 개발자 GA 그레이 테스트 자격, 언론 「풀버전 내일 출시 가능」 보도
2026년 7월 20일GA 정식판 출시(본문 게시일)
2026년 7월 24일구 인터페이스명 deepseek-chat·deepseek-reasoner 영구 중단

한 줄 요약: V4 프리뷰판도 이미 강력했지만, 풀버전은 Agent·수학 추론·코드 생성을 추가 강화하고 정식 상용 과금 체계를 갖췄습니다. 기반 MoE 아키텍처는 동일하며, GA 업그레이드는 안정성·최적화·상용 가격 구조에 집중합니다.

01

마이그레이션 기한 간과: deepseek-chat을 계속 쓰는 코드는 7월 24일 23:59(베이징 시간) 이후 영구 실효됩니다.

02

피크 시간대 무분별 호출: 평일 09:00–12:00, 14:00–18:00 요금 2배. 배치 작업을 오프피크로 돌리지 않으면 청구가 급증합니다.

03

Pro/Flash 미분류: 단순 라우팅에 V4-Pro를 쓰면 Flash(출력 $0.28/M)로 가능한 경량 작업을 낭비합니다.

04

캐시 히트 무시: Prompt Cache 미구축 시 Flash 캐시 히트 $0.0028/M 극저비용을 놓칩니다.

05

벤치마크 오독: SWE-bench Verified 80.6%는 OSS 최고이나 SWE-bench Pro에서는 Claude Fable 5(80.3%)가 여전히 선두——단일 랭킹으로 프로덕션 선정하지 마세요.

02

DeepSeek V4 Pro·Flash 아키텍처 심층: CSA, HCA, mHC, Muon

DeepSeek V4는 3가지 핵심 아키텍처 혁신으로 1M token 컨텍스트에서 KV Cache 메모리를 V3.2의 10%(V4-Flash 7%)까지 줄여 초장 컨텍스트를 경제적으로 실현합니다.

사양V4-ProV4-Flash
총 파라미터1.6조(1.6T)2840억(284B)
Token당 활성 파라미터490억(49B)130억(13B)
Transformer 레이어61층43층
컨텍스트 윈도우1,000,000 tokens1,000,000 tokens
최대 출력384K tokens384K tokens
정밀도FP4(전문가 가중치)+FP8(기타)FP4+FP8 혼합
사전학습 데이터33T+ tokens32T+ tokens
OSS 라이선스MITMIT

하이브리드 어텐션(CSA + HCA)

DeepSeek V4는 V2/V3 시대 Multi-head Latent Attention(MLA)을 버리고 두 가지 신규 어텐션 메커니즘을 결합합니다.

CSA

Compressed Sparse Attention: KV 시퀀스를 Softmax 게이트 풀링으로 4배 압축. FP4 「라이트닝 인덱서」로 top-k 희소 선택(Pro top-1024, Flash top-512). 최근 128 token 슬라이딩 윈도우 유지. 1M 컨텍스트 추론 FLOPs는 V3.2의 27%만.

HCA

Heavily Compressed Attention: token을 128배 압축 후 글로벌 밀집 어텐션으로 장거리 의존성 포착. CSA와 상보. V4-Flash는 앞 2층 HCA, 이후 CSA/HCA 교대. V4-Pro도 유사 구조.

Manifold-Constrained Hyper-Connections(mHC)와 Muon 옵티마이저

mHC는 기존 잔차 연결을 강화해 4채널 잔차 스트림을 도입합니다. 이중확률 행렬 제약(Birkhoff 다면체)을 만족하는 혼합 행렬로 61층 깊은 네트워크에서도 신호를 안정 전파합니다. Muon 옵티마이저(AdamW 대체)는 뉴턴-슐츠 직교화로 그래디언트를 처리해 수렴을 가속하고 학습을 안정화합니다.

추론 모드특징적용 시나리오
Non-think사고 체인 없음, 초고속 응답단순 Q&A, 라우팅
Think High명시적 추론(thinking 태그)중간 복잡도, 코드 디버깅
Think Max최대 추론 강도, 384K+ 컨텍스트 필요복잡 수학, 긴 체인 Agent

공식 권장 샘플링: temperature=1.0, top_p=1.0(전 모드 공통).

03

DeepSeek V4 벤치마크: SWE-bench Verified 80.6%와 가성비 비교

벤치마크DeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6%(OSS 최고)96.0%별도 미공개~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified는 실제 GitHub 저장소 Bug 수정을 측정하며, 80.6%는 현재 OSS 모델 최고점으로 Gemini 3.1 Pro와 동률입니다. SWE-bench Pro는 더 엄격하며 Claude Fable 5의 80.3%가 현재 선두입니다.

Artificial Analysis 평가: Claude Fable 5는 Strategy & Ops 지수 작업 1회 $3.48(50점), DeepSeek V4-Pro 동종 작업 $0.03(38점)——비용은 Fable 5의 116배, 점수 차는 약 12점.

차원DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
OSS/셀프호스트MIT OSS폐쇄형폐쇄형
컨텍스트1M tokens미공개1M tokens
API 출력(오프피크)$0.87/M~$15/M$50/M
피크 출력$1.74/M
코드 능력매우 강함(Fable 5 근접)매우 강함최강(SWE-bench Pro)
데이터 프라이버시프라이빗 배포 가능불가불가

시나리오 선정: 예산 제한/고빈도 호출/프라이빗 배포 → V4-Pro 또는 V4-Flash; 극한 코드 능력·비용 무관 → Claude Fable 5; 복잡 알고리즘+수학 추론 → GPT-5.6 Sol/Ultra; 초대규모 로그/문서 처리 → V4-Flash(캐시 히트 입력 $0.0028/M).

04

DeepSeek V4 피크/오프피크 과금 상세와 API 마이그레이션 6단계

GA판 최대 관심사는 DeepSeek 최초의 피크/오프피크 차등 요금입니다. 전력 시간대 요금과 유사합니다. 피크 시간(베이징): 평일 09:00–12:00, 14:00–18:00, 요금 2배.

모델과금 항목오프피크피크
V4-Pro입력(캐시 히트)¥0.025 / $0.0035 / 1M2배
V4-Pro입력(캐시 미스)¥3.00 / $0.435 / 1M¥6.00 / $0.87
V4-Pro출력¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash입력(캐시 히트)¥0.02 / $0.0028 / 1M2배
V4-Flash입력(캐시 미스)¥1.00 / $0.14 / 1M¥2.00 / $0.28
V4-Flash출력¥2.00 / $0.28 / 1M¥4.00 / $0.56

절감 4전략: ① 비실시간 작업을 오프피크(18:00 이후 또는 09:00 이전)로 배치; ② Prompt Cache로 캐시 히트율 향상; ③ Flash로 분류, 복잡 추론은 Pro로; ④ DeepSeek 과금 변경 24시간 전 이메일 확인. 피크에도 V4-Pro 출력 $1.74/M는 Claude Opus 4.8($15/M)보다 8.6배 저렴합니다.

중요: 구 모델명 deepseek-chat·deepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 7월 24일 23:59)에 영구 중단됩니다.

구 모델명신 모델명비고
deepseek-chatdeepseek-v4-flash(비사고 모드)고속, 경량 작업
deepseek-reasonerdeepseek-v4-flash(사고 모드)또는 deepseek-v4-pro로 업그레이드

API 마이그레이션 6단계:

01

전체 저장소 검색: 코드베이스에서 deepseek-chat·deepseek-reasoner 전체 참조를 검색합니다.

02

매핑 교체: 경량 채팅 → deepseek-v4-flash; 구 추론 모드 → Flash 사고 모드 또는 deepseek-v4-pro.

03

OpenAI SDK 업데이트: model만 변경, base_urlhttps://api.deepseek.com 유지.

04

사고 모드 활성화(선택): extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}로 구 reasoner 동작 대체.

05

Anthropic SDK 호환: V4는 OpenAI ChatCompletions·Anthropic Messages 형식 모두 지원. model만 갱신하면 됩니다.

06

Staging 검증: 7월 24일 전 테스트 환경 전량 회귀 완료, 구 모델명 호출 잔존 없음 확인.

python
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
05

DeepSeek V4 풀버전 업그레이드 가치? 인용 가능 데이터와 결론

DeepSeek V4 GA 정식판은 2026년 OSS LLM 분야 최중요 마일스톤 중 하나입니다. 가치는 Claude Fable 5·GPT-5.6을 이기는 것(아직은 아님)이 아니라, 폐쇄형 플래그십 1/10~1/100 비용으로 OSS 모델 중 최강 성능을 제공하는 데 있습니다.

A

80.6%/OSS 1위: SWE-bench Verified OSS 최고, Gemini 3.1 Pro와 동률.

B

10%/7%: 1M token 시나리오 KV Cache 메모리 V3.2의 10%(Flash 7%).

C

$0.03/116배: V4-Pro Strategy & Ops 1회 $0.03, Fable 5 $3.48——116배 가격차, 24% 성능차.

데이터 해외 반출을 원치 않는 기업, 예산 제한 독립 개발자, 1M token 장컨텍스트 Agent 엔지니어, 극한 가성비 AI 제품팀에게 DeepSeek V4 Pro는 현재 약점이 적은 선택입니다. 피크/오프피크 과금은 비용 복잡도를 높이지만 본질적으로 여전히 매우 경쟁력 있습니다——「가격 파괴자」에서 「규칙 있는 상용 플랫폼」으로의 전환은 성숙 신호입니다.

대안 정리: 개인 Mac만으로 DeepSeek Agent 부하 테스트 시 슬립·네트워크 변동으로 장컨텍스트 작업이 중단되기 쉽습니다. 폐쇄형 API만 의존하면 V4 MIT OSS+$0.87/M 출력 가격의 비용·데이터 주권 면에서 열세입니다. 7월 24일 마이그레이션 기한 무시 시 프로덕션 하드 중단됩니다. iOS CI/CD, DeepSeek V4 Agent 7×24 자동화, 로컬 ds4 추론 검증이 필요한 프로덕션 환경에서는 KVMNODE 전용 Mac Mini M4 클라우드 대여가 통상 더 나은 선택입니다. Apple Silicon 통합 메모리, sudo 개방, 일/주/월 유연 주문. 자세히 가격 페이지, 고객 센터, 바로 주문을 참고하세요.

데이터 기준: 2026년 7월 20일 · 출처: DeepSeek 공식 문서, arXiv:2606.19348, HuggingFace, Artificial Analysis