DeepSeek V4 Flash 정식판 공개: 7월 31일에 무엇이 나왔나
7월 31일 DeepSeek은 V4-Flash를 정식판으로 업데이트했습니다. 파라미터 수는 유지, 후훈련만으로 성능이 올랐고 더 큰 V4-Pro 프리뷰를 벤치마크에서 앞섰습니다. 가격은 Claude Opus 4.8의 수십 분의 일입니다. 핵심은——이번이 신규 모델 출시가 아닙니다. 동일 284B 모델의 후훈련을 다시 한 것입니다. 진정한 플래그십 V4-Pro 정식판과 DeepSeek 최초 자체 Agent 프레임워크 Harness는 아직 「곧 공개」 상태이며 확정 일정이 없습니다.
| 날짜 | 이벤트 | 핵심 내용 |
|---|---|---|
| 2026-04-24 | V4 프리뷰 공개 | V4-Pro(1.6T/49B)·V4-Flash(284B/13B) OSS, 1M token 컨텍스트, MIT |
| 2026-07-24 | 구 API 폐지 | deepseek-chat·deepseek-reasoner 중단, V4 명명으로 전환 |
| 2026-07-27 | Kimi K3 가중치 공개 | Moonshot AI 2.8T 가중치 Hugging Face, 경쟁 압박 강화 |
| 2026-07-31 | V4-Flash-0731 정식판 | API 공개 테스트 + HF 가중치 동기화; changelog에서 Harness 「곧 공개」 최초 언급; API만, App/웹 미갱신 |
| 2026-08-05 기준 | V4-Pro 정식판 | 「가능한 한 빨리 공개」만, 공식 일정 없음; 8/10–20 GA 보도는 미확인 |
「정식판」을 신규 모델로 오해: 4월 프리뷰와 아키텍처·파라미터 수 동일. 향상은 확장이 아닌 후훈련입니다.
Harness 점수를 범용 능력으로 동일시: Terminal Bench 2.0 등 Agent 점수는 미공개 Harness 미니멀 모드 측정입니다.
API-only 제한 간과: 7/31 업데이트는 API만. 소비자 App·웹은 구버전입니다.
미확인 Pro 공개일 신뢰: 「8월 10–20일 GA」는 익명 출처. 공식은 「가능한 한 빨리」뿐입니다.
벤더 자체 보고와 제3자 평가 혼동: Artificial Analysis Intelligence Index와 DeepSeek Agent 자체 보고는 방법론이 달라 단순 합산 불가합니다.
DeepSeek V4 Flash 가격·사양: Kimi K3·Qwen3.8-Max와의 차이
| 모델 | 상태 | 총/활성 파라미터 | 컨텍스트 | 입력(미스/히트 $/M) | 출력($/M) | 라이선스 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 정식판(07-31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 프리뷰(정식판 미공개) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 가중치 공개(07-27) | 2.8T / ~104B(커뮤니티 추정) | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| Qwen3.8-Max | API GA(08-02), 가중치 미공개 | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 오픈 약속 |
Artificial Analysis 제3자 지수: V4-Flash Intelligence Index 50, 태스크당 약 $0.03——Kimi K3($0.86)의 약 1/29, GPT-5.6 Sol($1.86)의 약 1/62, Claude Fable 5($3.15)의 약 1/105. DeepSeek이 노리는 것은 「최고 점수」가 아니라 「충분한 지능 + 극한 가격」입니다.
참고: 위 가격은 벤더 공개 자료입니다. DeepSeek은 API에 「피크 시간대 2배 요금」(베이징 시간 9–12시, 14–18시)을 예고했으나 작성 시점 시행일은 미발표입니다.
아키텍처 불변·후훈련 강화: CSA+HCA, mHC, Muon, Harness란
V4-Flash-0731은 4월 프리뷰와 파라미터 규모·구조가 동일하며 DeepSeek은 성능 향상이 「전적으로 후훈련 재실시」에서 비롯됐다고 명시했습니다. 284B 총·13B 활성 Flash가 수 배 큰 V4-Pro 프리뷰를 여러 Agent 벤치에서 앞섭니다——2026년 하반기 경쟁에서 후훈련 품질이 단순 파라미터 확대에 근접하거나 넘어서고 있습니다.
압축 희소 attention + 고도 압축 attention(HCA): 대외적으로 DSA 희소 attention으로 통일. 장컨텍스트에서 연산·VRAM 절감이 목적입니다.
다양체 제약 하이퍼커넥션: 기존 잔차 연결을 개선해 심층 네트워크에서 신호를 안정 전파합니다.
Muon 옵티마이저: 기존 옵티마이저를 대체해 수렴 속도와 안정성을 높입니다.
DeepSeek 공식: 100만 token 컨텍스트에서 V4-Pro는 V3.2 대비 추론 FLOPs 27%, KV Cache 점유 10%——독립 제3자 재현은 없으나 사실이라면 백만 token 컨텍스트가 주류 길이와 유사한 비용으로 상용화될 수 있습니다.
DeepSeek Harness는 7월 31일 changelog에서 최초로 공식 언급된 자체 Agent 실행 프레임워크입니다. 파일 읽기/쓰기, 도구 호출, 명령 실행, 엔드투엔드 엔지니어링 태스크를 처리하며 Claude Code에 대응합니다. 공개 Agent 점수(Terminal Bench 2.0 82.7점, V4-Pro 프리뷰 67.9점 초과)는 모두 Harness 「미니멀 모드」 측정이며 프레임워크 자체는 미공개입니다. changelog는 「점수는 harness 선택에 매우 민감하며 모델 능력 향상과 동일시할 수 없다」고 명시했습니다.
6단계 API 체크리스트: 마이그레이션·선정·비용 부하 테스트
model 이름이 신판을 가리키는지 확인: OpenAI/Anthropic 형식에서 deepseek-v4-flash는 자동으로 V4-Flash-0731 정식판을 가리킵니다. 코드 구조 변경 불필요합니다.
폐지된 구명 검색: 코드베이스 전체에서 deepseek-chat·deepseek-reasoner 검색——7월 24일 이후 사용 불가합니다.
Flash와 Pro 프리뷰 분리: 배치 Agent/고빈도 경량 태스크는 Flash(출력 $0.28/M). 복잡 추론은 당분간 V4-Pro 프리뷰, 정식판 후 재평가합니다.
Prompt Cache 전략 구축: system prompt·도구 정의 prefix 재사용으로 캐시 히트 시 입력을 $0.0028/M대로 압축합니다.
Harness 점수만으로 프로덕션 선정 금지: Claude Code, Cursor, 자체 Agent 프레임워크로 staging A/B 후 커뮤니티 Terminal Bench 2.0 독립 재현을 기다립니다.
캐시 히트율·타임아웃 모니터링: 해외 커뮤니티에서 입력 캐시 히트율 저하, 안전 분류기 타임아웃이 보고됩니다. 실제 workload 부하 테스트 후 전량 전환하세요. Agent 7×24 상주는 고객 센터 참고.
from openai import OpenAI
client = OpenAI(api_key="your_key", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "이 CI 로그의 빌드 실패 원인을 분석해 주세요..."}],
)벤치마크 논쟁, 「킬 라인」, 업계 맥락: 세 가지 핵심 수치
V4 정식판 이전 Pro가 「7월 중순 풀 공개」 기대를 지키지 못해 중국 AI 커뮤니티에서 양원봉을 「양백개」로 놀리던 시기가 있었습니다. V4-Flash-0731 공개 후 성과가 기대를 넘어 「양성」으로 되돌아가는——이런 익살 별칭 반전은 중국 AI 커뮤니티 감정의 흥미로운 지표입니다.
중국 개발자 커뮤니티에는 「킬 라인(斬殺線)」 개념이 퍼져 있습니다. DeepSeek이 「충분한 성능 + 극단적 저가」로 경쟁사에 문턱을 세운다——성능이 뚜렷이 앞서지 않으면서 더 낮은 가격도 못 내는 모델은 시장에서 존재감을 잃는다는 설명입니다. GPT-5.6 Luna 80% 인하 등 밀집 가격 조정도 이 맥락에서 이해됩니다. 7월 31일 NVIDIA·Broadcom·AMD 등 칩 주가는 크게 움직이지 않았습니다——시장이 「DeepSeek식 효율 돌파」에 익숙해져 단순 악재로 보지 않는 측면입니다.
82.7 vs 67.9 / Terminal Bench 2.0: Flash 정식판이 V4-Pro 프리뷰 초과. Harness 미니멀 모드 + max 설정(top_p=0.95, temperature=1.0)의 벤더 자체 보고·특정 프레임워크 결과입니다.
50 / Intelligence Index: Artificial Analysis 종합 지수에서 V4-Flash는 최고가 아니며 Kimi K3에 열세——그러나 태스크당 비용은 극히 낮습니다.
1/29~1/105 / 비용 배율: Kimi K3, GPT-5.6 Sol, Claude Fable 5 대비 태스크당 비용 약 1/29, 1/62, 1/105——OpenRouter 호출량 7주 연속 1위의 이유입니다.
주의: V4-Pro 정식판·Harness 공개 시점, 약 74억 달러 조달·IPO 루머 등은 현재 재경 매체 「보도에 따르면」 또는 커뮤니티 루머가 중심이며 DeepSeek 공식·규제 신고 직접 확인은 없습니다. 검증된 사실과 구분하세요.
실무 대안에도 숨은 비용이 있습니다: 폐쇄 API만 의존하면 Agent 대규모 호출에서 V4-Flash $0.28/M 출력에 맞서기 어렵습니다; 개인 Mac에서 7×24 Agent 부하 테스트는 절전·네트워크 단절·캐시 히트율 영향을 받습니다; Harness 점수 한계 무시는 프로덕션 선정 오류로 이어집니다. iOS CI/CD, DeepSeek Agent 자동화, 다중 모델 A/B가 필요한 프로덕션 환경에서는 KVMNODE 전용 Mac Mini M4 클라우드 대여가 보통 더 적합합니다: 네이티브 Apple Silicon, 전체 sudo, 다중 리전, 일/주/월 유연 과금. 가격 페이지, 고객 센터, 바로 주문을 참고하세요.
데이터 기준: 2026년 8월 5일 · 출처: DeepSeek 공식 API 문서·changelog, 기술 보고서《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》, Artificial Analysis(재경 매체 인용), 21세기경제보道, V2EX 커뮤니티