Kimi K3 오픈 웨이트, Moonshot AI, 오픈 웨이트 대규모 언어 모델에 관심 있는 AI 개발자와 엔지니어링 팀을 위한 글입니다. API 공개 후 약 1주가 지났고 7월 27일에 완전 가중치가 공개됩니다. 본문은 TL;DR과 공개 일정, 2.8T 전체 사양과 아키텍처, 오픈 웨이트 vs 오픈소스 구분, Claude Fable 5/GPT-5.6 Sol 벤치마크 비교, API 요금과 6단계 운영 체크리스트, 7월 27일 Hugging Face 공개 세부, 자체 호스팅 하드웨어 요건, 업계 동향, FAQ 6개를 모두 다룹니다. 아키텍처 심층 분석은 Kimi K3 심층 리뷰, 함께 읽을 글: GPT-5.6 Sol 출시 해설, DeepSeek V4 풀버전 해설.
01

TL;DR: 7/16 API 공개, 7/27 가중치 OSS——폐쇄형 프리미엄은 유지될까

핵심 결론: 7월 16일 Kimi App/Work/Code/API가 선행 공개되었고 7월 27일 Modified MIT로 완전 가중치 + 기술 보고서가 공개됩니다. K3는 지금까지 최대 오픈 웨이트(2.8T)이지만 Fable 5 killer는 아닙니다——Artificial Analysis Intelligence Index v4.1에서 57.1점, 3/189위, Fable 5(59.9)와 GPT-5.6 Sol(58.9)에 미치지 못합니다. 강점은 약 1/3 비용으로 전沿에 가까운 지능 + 오픈 웨이트 + 100만 token 컨텍스트입니다.

2026년 7월 16일 심야 Moonshot AI(월지암면)가 API 문서 상단에 「Kimi K3 출시」 배너를 게시했습니다——대규모 발표회 없이 기술 블로그 1편, 요금 페이지 1개, 즉시 호출 가능한 모델 ID kimi-k3만 있습니다. 저조한 자세와 2.8조 파라미터 규모가 대조를 이룹니다. 완전 가중치는 7월 27일 Hugging Face에서 Modified MIT 라이선스로 공개되며 K3는 다운로드 가능한 오픈 웨이트 중 최대 규모가 됩니다.

날짜마일스톤핵심 내용
2026-07-16API 정식 공개Kimi App/Work/Code/API 전면 이용 가능; Artificial Analysis 독립 평가 시작
2026-07-17WAIC/신화사2026 세계 인공지능 대회 개막 전야, 신화사 등이 K3 이정표 의미 보도
2026-07-27Hugging Face 가중치완전 모델 가중치(Modified MIT)+기술 보고서; vLLM KDA/prefix caching Day-0 지원

왜 이번 가중치 공개가 중요한가? Moonshot AI는 지난 18개월 DeepSeek 부상의 충격을 겪었습니다——K2로 순위를 7위에서 전沿으로 끌어올리고 K2.5로 코딩 역량을 공고히 했으며 K3는 2.8T 규모+1M 컨텍스트+오픈 웨이트 3연타로 중국 AI가 「저가로 시장을 잡는 것」에서 「지능 전沿에 도전하는 것」으로 전환했음을 보여줍니다. 공개 시점은 WAIC와 겹치며 7월 1일 Anthropic이 Fable 5 해외 사용자 접근을 일시 제한했다가(현재 복구) 지정학과 모델 경쟁이 맞물립니다.

01

규모 기록: 2.8T는 최대 오픈 웨이트로 DeepSeek V4 Pro(1.6T)를 약 75% 앞섭니다.

02

지능 포지션: AA Index 57.1로 3위, 1위와 격차는 2.8점뿐——OSS/오픈 웨이트와 폐쇄형 전沿 격차는 2–3점으로 축소되었습니다.

03

비용 우위: API 요금은 서구 품질대($3/$15)에 맞추지만 실효 비용은 폐쇄형 플래그십의 약 1/3입니다.

04

선정 오판: 「파라미터 최대=모든 벤치마크 1위」가 아닙니다. 7/27 전에 풀 가중치 로컬 실행을 가정하지 마세요. FrontierSWE에서 Fable 5가 여전히 앞섭니다.

02

Kimi K3 전체 사양: 2.8T Stable LatentMoE와 KDA 아키텍처

Kimi K3는 단순한 파라미터 누적이 아닙니다——아키텍처 층에서 여러 엔지니어링 혁신을 도입해 장 컨텍스트와 초희소 MoE 학습의 실제 병목을 해결합니다. Kimi K2 대비 전체 스케일 효율은 약 2.5배 향상되었습니다.

사양
총 파라미터 수2.8조(2.8T)
MoE 아키텍처Stable LatentMoE: 896 전문가/16 활성(희소도 1.8%)
어텐션 메커니즘KDA + AttnRes + Gated MLA
컨텍스트 윈도우1,048,576 tokens(1M)
입력 모달리티텍스트, 이미지, 비디오(네이티브 시각 이해)
학습 정밀도MXFP4 가중치 + MXFP8 활성화(양자화 인지 설계)
스케일 효율K2 대비 약 2.5배 향상
장 컨텍스트 디코딩KDA로 1M token에서 디코딩 속도 6.3배 향상
기술 구성요소역할
Kimi Delta Attention(KDA)3:1 선형/전체 어텐션 교대, KV 캐시 메모리 75% 감소, 100만 token 디코딩 6.3× 가속
Attention Residuals(AttnRes)깊이를 가로지르는 선택적 검색, 약 25% 학습 효율 향상
Quantile Balancing라우터 점수 분위수에서 전문가 할당 도출, 휴리스틱 하이퍼파라미터 제거
Per-Head Muon각 어텐션 헤드 독립 최적화, 대규모 학습을 더 적응적으로
Sigmoid Tanh Unit(SiTU)활성화 함수 제어 개선
Gated MLA어텐션 선택성 향상

오픈 웨이트(Open Weights) vs 오픈소스(Open Source): K3는 어느 쪽인가

7월 27일 공개 전에 정리해야 할 개념입니다. open weightsopen source는 동의어가 아닙니다.

차원오픈 웨이트(Open Weights)완전 오픈소스(Open Source)
모델 가중치다운로드 가능다운로드 가능
학습 코드보통 비공개공개
학습 데이터보통 비공개공개 또는 목록 공개
미세조정/자체 호스팅허용허용
라이선스 예Modified MIT, Llama LicenseApache 2.0, MIT(코드 포함)
Kimi K37/27 이후 이 범주학습 세부사항 미완전 공개

K3는 7월 27일 Modified MIT 라이선스로 완전 가중치를 공개합니다——다운로드, 미세조정, 자체 호스팅은 가능하지만 학습 코드와 데이터는 완전히 공개되지 않았습니다. r/LocalLLaMA와 Hacker News에서는 많은 개발자가 이를 「Llama식 풀스택 OSS」가 아닌 「오픈 웨이트 이정표」로 봅니다. 데이터 레지던시와 모델 통제가 필요한 기업에는 오픈 웨이트로 충분합니다. 학습 과정 재현을 원하는 연구기관은 기술 보고서 추가 공개를 기다려야 합니다.

03

벤치마크: AA Index 57.1로 3위——강점과 약점

아래는 Artificial Analysis와 Moonshot AI 자체 보고 핵심 벤치마크입니다(모델마다 서로 다른 추론 harness 사용: K3는 Kimi Code, GPT는 Codex, Claude는 Claude Code). Moonshot AI는 공식 블로그에서 약점을 솔직히 인정하며 GDPval, DeepSWE 등 열위 항목을 회피하지 않습니다.

종합 순위(AA Index v4.1)점수순위
Claude Fable 559.9#1
GPT-5.6 Sol58.9#2
Kimi K357.1#3/189

K3가 앞서는 영역

벤치마크Kimi K3Claude Fable 5GPT-5.6 Sol
Frontend Code Arena#1
Automation Bench30.829.129.7
SpreadsheetBench 2선두
BrowseComp91.288.090.4
SWE Marathon42.035.039.0
Terminal Bench 2.188.384.688.8
Program Bench77.876.877.6
FrontierSWE81.286.671.3

K3가 뒤처지는 영역

벤치마크Kimi K3Claude Fable 5GPT-5.6 Sol비고
GDPval v2 Elo1668–168717601748범용 대화 품질 격차
DeepSWE67.570.073.0복잡 Repo급 버그 수정
환각률K2.6 대비 상승공식적으로 지속 개선 필요 인정
출력 polish/분산Fable/Sol보다 약함선두선두장문 일관성과 스타일 안정성

공식 솔직한 입장: Moonshot AI는 kimi.com/en/blog/kimi-k3에서 K3 부족을 명시합니다——DeepSWE, GDPval 등 열위를 회피하지 않고 Frontend Code Arena 등 강점도 과장하지 않습니다. 방향성 참고로 활용하고 프로덕션 선정 시 자체 평가 세트로 검증하세요.

OSS/오픈 웨이트와 폐쇄형 전沿 지능 격차는 2024년 10점 이상에서 2026년 2–3점으로 축소되었습니다. K3는 Fable 5 killer가 아니지만 약 1/3 비용으로 전沿에 가까운 역량을 제공하며 폐쇄형 프리미엄이 시험받고 있습니다.

04

API 요금과 6단계 운영 체크리스트: 연동부터 7/27 공개일까지

과금 항목Kimi K3Claude Sonnet 5DeepSeek V4 Pro
입력($/M)$3.00$3.00$1.74
캐시 적중 입력$0.30$0.145
출력($/M)$15.00$15.00$3.48
컨텍스트1M200K128K

K3 표준가는 Claude Sonnet 5와 동일($3/$15)하여 서구 품질대에 맞추지만 컨텍스트 윈도우는 5배입니다. Artificial Analysis 산출: AA 단일 태스크 비용 $0.94, Sol보다 9.4% 낮고 Fable 5보다 65.8% 낮습니다. 코딩 시나리오 캐시 적중률 90%+로 실효 입력 비용은 약 $0.55/M까지 내려갑니다.

6단계 운영 체크리스트(API 연동 + 7/27 공개일 준비):

01

API Key 연동: platform.kimi.ai에서 키를 생성하고 base_urlhttps://api.moonshot.ai/v1, 모델 ID kimi-k3로 설정합니다. 또는 kimi.com에서 무료 계정을 등록해 App/Work/Code를 직접 사용합니다.

02

캐시 최적화: 코딩 Agent 워크플로에서 system prompt와 도구 정의 접두사를 재사용합니다. Mooncake 분 추론 아키텍처에서 캐시 적중률 90%+가 가능하며 실효 입력 단가는 $0.30/M까지 내려갑니다.

03

7/27 HF 파일 확인: Hugging Face 저장소에 완전 가중치 샤드, config.json, tokenizer, LICENSE(Modified MIT 조항) 업로드를 확인합니다.

04

양자화 버전 검증: MXFP4/NVFP4 양자화 버전(4-bit 약 1.4TB)을 다운로드하고 공식 tech report와 파라미터 수·아키텍처 설명을 대조합니다.

05

추론 프레임워크 배포: vLLM(KDA+prefix caching) 또는 SGLang으로 서버 서비스를 시작하고 공식 Day-0 명령을 참고합니다. Ollama/GGUF 버전은 이후에 이어질 전망입니다.

06

하드웨어와 장 컨텍스트 재검증: 최소 64+ 가속 카드 슈퍼노드 구성을 확인합니다. 1M token 시나리오에서 디코딩 지연과 KDA 6.3× 가속이 기준을 충족하는지 재테스트합니다.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "이 코드를 분석해 주세요..."}]
)
05

7/27 가중치 공개, 자체 호스팅 방안과 업계 동향

7월 27일 공개 내용

Moonshot AI는 공식 WeChat 공지에서 7월 27일 완전 모델 가중치 공개를 명확히 밝혔습니다. 공개 내용은 다음과 같습니다.

HF

Hugging Face 완전 가중치(Modified MIT 라이선스)

TR

기술 보고서(Tech Report)——아키텍처, 학습, 벤치마크 세부

VL

vLLM Day-0 지원——KDA 커널 + prefix caching

OL

Ollama/GGUF 양자화 버전——커뮤니티는 수일 내 후속을 예상

자체 호스팅 하드웨어 요건과 3가지 적용 시나리오

구성 항목요건참고
4-bit 양자화 저장약 1.4TBMXFP4/NVFP4 버전
프로덕션 추론64+ 가속 카드 슈퍼노드K2.7 Code INT4 ~577GB 대비 K3 규모 더 큼
일반 팀API가 올바른 선택Northflank, VentureBeat 등은 대부분 시나리오에서 API 권장
자체 호스팅 시나리오권장 여부이유
데이터 레지던시/컴플라이언스7/27 이후 가능가중치 로컬 실행, 데이터 국외 반출 없음
도메인 미세조정7/27 이후 가능오픈 웨이트로 fine-tuning 허용
초고호출량정밀 계산 필요64+ 카드 CAPEX vs API OPEX, 자체 ROI 모델 필요

업계 동향: 중국 AI 물결과 폐쇄형 프리미엄 시험

2026년 7월 중국 AI OSS/오픈 웨이트 생태계는 밀집 공개 시기를 맞았습니다——GLM-5.2, DeepSeek V4 Pro, MiniMax 등이 잇따라 등장했습니다. Moonshot AI는 DeepSeek R1 충격 후 순위 약 7위에서 K2→K2.5→K3 3연속 도약으로 comeback을 이뤘습니다. WAIC 2026 타이밍과 7월 1일 Anthropic의 Fable 5 해외 사용자 제한(복구됨)이 지정학적 배경을 형성합니다——오픈 웨이트는 폐쇄형 전沿과의 2–3점 격차를 줄이며 폐쇄형 API 「품질 프리미엄」이 3–5배 가격차를 유지할 수 있는지가 다음 분기 핵심 과제입니다.

A

2.8T/#1 오픈 웨이트: 지금까지 최대 다운로드 가능 오픈 웨이트, DeepSeek V4 Pro(1.6T)를 약 75% 앞섭니다.

B

57.1/2.8점: AA Index v4.1 3위(3/189), Fable 5(59.9)와 격차 2.8점, OSS/폐쇄형 지능 격차 2–3점.

C

$0.94/65.8%: AA 단일 태스크 비용 $0.94, Fable 5보다 65.8% 낮고 Sol보다 9.4% 낮음——약 1/3 비용으로 전沿에 가까운 지능.

요약: Kimi K3 오픈 웨이트 공개는 2026년 AI 분야 가장 중요한 이정표 중 하나입니다. Fable 5 killer는 아니지만 장시간 코딩, 문서 이해, 1M 컨텍스트 등 핵심 영역에서 경쟁력을 갖추었고 Modified MIT로 완전 가중치 다운로드를 약속합니다——중국 AI가 「저가로 시장을 잡는 것」에서 「지능 전沿에 도전하는 것」으로 전환했음을 보여줍니다. 주목 일정: 7월 22일(본문)→ 7월 27일 Hugging Face 가중치 + tech report.

대안을 정리합니다. 개인 Mac만으로 Kimi Code/API Agent 부하 테스트는 슬립과 네트워크 대역폭 변동으로 장 컨텍스트 작업이 쉽게 중단됩니다. 7/27 자체 호스팅 대기는 64+ 카드 슈퍼노드가 필요해 중소 팀에는 단기간 비현실적입니다. 단일 폐쇄형 API 완전 의존은 K3의 1M flat 요금 우위를 컨텍스트 길이와 비용 모두에서 커버하기 어렵습니다. iOS CI/CD, Kimi Code 상시 가동, AI Agent 7×24 자동화 프로덕션 환경에는 KVMNODE 전용 Mac Mini M4 클라우드 대여가 보통 더 나은 선택입니다. Apple Silicon 통합 메모리, sudo 개방, 일/주/월 유연 주문. 자세한 내용은 가격 페이지, 고객 센터, 또는 직접 주문을 참고하세요.

데이터 기준: 2026년 7월 22일 · 출처: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis, VentureBeat, Northflank, r/LocalLLaMA, Hacker News