Kimi K3는 오픈소스인가, 아니면 오픈 웨이트인가?
짧은 답: 엄격한 정의로는 아닙니다——Moonshot AI도 그렇게 주장하지 않습니다. 2026년 7월 27일 Moonshot은 Kimi K3의 전체 가중치와 기술 보고서를 공개했습니다. 이는 2.8조 파라미터 Mixture-of-Experts 모델로 네이티브 시각 이해를 지원합니다. 약 1.56TB 다운로드는 Hugging Face에서 30분 이내 트렌드 1위를 기록했으며, K3는 지금까지 완전 공개된 최대 오픈 웨이트 모델입니다.
| 날짜 | 마일스톤 | 핵심 내용 |
|---|---|---|
| 7월 16일 | API 출시 | Kimi App / Work / Code / API 가동, 가중치 미공개 |
| 7월 17일 | WAIC 2026 | 국영 매체가 파라미터 수 기준 세계 최대 오픈 모델로 보도 |
| 7월 22–23일 | 증류 분쟁 | 백악관 과학 고문 Kratsios가 Moonshot의 Anthropic Fable 대상 산업 규모 증류 비난 |
| 7월 27일 | 전체 가중치 공개 | 완전 가중치 + 기술 보고서 + MoonEP / AgentEnv(FlashKDA는 선행 공개) |
| 7월 28일 | 상무부 대응 | 중국 상무부가 워싱턴의 「AI 패권주의」 비난 |
오픈 웨이트와 오픈소스 혼동: Moonshot은 「open source」라고 말하지 않으며, 학습 데이터와 전체 학습 코드는 비공개입니다.
라이선스 게이트 과소평가: K3에는 MaaS 매출 2,000만 달러 임계값과 1억 MAU 귀속 표시 의무가 추가되었으며 K2 패밀리에는 없었습니다.
소비자 하드웨어로 구동 가능하다고 가정: 2.8T 파라미터, 896 전문가——Moonshot은 64장 이상 가속 카드 슈퍼노드를 권장합니다.
파라미터만 쫓고 비용 무시: K3는 오픈 웨이트 역량 상한이지만 작업당 약 $0.95로 GLM-5.2(약 $0.47)보다 비쌉니다.
지정학적 컴플라이언스 무시: 미중 증류 분쟁과 WAIC 2026 시점이 겹쳐 기업 구매에 공급망 리스크가 더해집니다.
Kimi K3 사양과 아키텍처: KDA, AttnRes, Per-Head Muon
| 사양 | 값 |
|---|---|
| 총 파라미터 | 2.8조 |
| 활성 파라미터 | 약 1,040억 |
| 전문가 구성 | 896 라우팅 전문가, 토큰당 16 활성화(희소성 약 1.8%) |
| 어텐션 | Kimi Delta Attention(KDA) + Gated Multi-Head Latent Attention(MLA) |
| 컨텍스트 윈도우 | 1,000,000 토큰 |
| 멀티모달 | 네이티브 비전(ViT-V2, 27층) |
| 가중치 형식 | MXFP4 가중치, MXFP8 활성화(SFT부터 양자화 인식 학습) |
| 다운로드 크기 | 약 1.56TB(Hugging Face) |
| 라이선스 | 커스텀——Moonshot은 「open weight」라 부르며 「open source」는 아님 |
Kimi Delta Attention(KDA)는 단일 스칼라 망각 게이트를 채널별 게이팅으로 대체합니다. 각 특징 차원이 독립 감쇠율을 가지며 chunkwise DPLR로 선형 시간 재귀를 구현합니다. K3는 KDA와 Gated MLA 층을 교차 배치——100만 토큰 윈도우와 최소 KV 캐시의 핵심입니다.
Attention Residuals(AttnRes)는 균일 잔차 누적을 선택적·입력 의존 동적 집계로 대체합니다——파라미터 2% 미만 증가로 학습 효율 약 25% 향상합니다.
Per-Head Muon은 각 어텐션 헤드를 독립 최적화합니다. Stable LatentMoE는 Quantile Balancing을 사용하며 MoonEP가 계산 랭크별 중복 전문가 상한을 수학적으로 증명합니다.
| 구성 요소 | 해결 과제 | 핵심 이점 |
|---|---|---|
| KDA | 장시퀀스 KV 캐시 폭발 | 선형 시간 재귀, 최소 VRAM |
| AttnRes | 깊은 층에서 초기 신호 희석 | 학습 효율 약 25% 향상 |
| Per-Head Muon | 헤드 간 균일 옵티마이저 | 적은 활성 파라미터로 프론티어급 결과 |
| Stable LatentMoE | 대규모 MoE 전문가 부하 불균형 | 896 중 16 활성——희소성 1.8% |
세 가지 인프라 공개와 벤치마크: GPT-5.6, Claude, GLM-5.2 비교
| 기술 | 역할 | 핵심 수치 |
|---|---|---|
| MoonEP | 초대규모 MoE 통신 | 과부하 전문가 복제, 랭크별 중복 전문가 상한 증명 |
| FlashKDA | CUTLASS KDA 커널 | H20에서 prefill flash-linear-attention 대비 1.72×–2.22× 빠름 |
| AgentEnv | Firecracker microVM 에이전트 샌드박스 | checkpoint 약 133ms, 재개 약 49ms, 메모리 오버커밋 최대 6.5배 |
SWE-bench Verified(독립 평가, Vals AI, 2026년 7월):
| 모델 | 점수 | 출시일 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| GLM-5.2(max) | 51(AA Index) | 이전 오픈 웨이트 1위 |
Artificial Analysis Intelligence Index(max 추론)에서 Kimi K3는 약 57점——종합 3위, 오픈 웨이트 1위입니다. 오픈 웨이트 티어의 역량 상한이지만 작업당 약 $0.95로 GLM-5.2(약 $0.47)보다 비쌉니다. 현재 Arena.ai Frontend Code Arena 1위입니다.
상업 라이선스 게이트와 6단계 배포 체크리스트
Moonshot은 일관되게 「오픈 웨이트」 공개라 부르며 「오픈소스」라고 하지 않습니다. 라이선스는 완전 커스텀 문서이며 K2 패밀리에 없던 두 가지 상업 임계값이 있습니다:
| 게이트 | 트리거 | 요건 |
|---|---|---|
| MaaS 매출 게이트 | Model-as-a-Service 매출이 지난 12개월 2,000만 달러 초과 | Moonshot AI와 별도 상업 계약 |
| 귀속 표시 게이트 | 월간 활성 사용자 1억 초과 또는 월 매출 2,000만 달러 초과 | 제품 UI에 「Kimi K3」 눈에 띄게 표시 |
| 토큰 유형 | 백만 토큰당 가격 |
|---|---|
| 입력(캐시 적중) | $0.30 |
| 입력(캐시 미스) | $3.00 |
| 출력(추론 트레이스 포함) | $15.00 |
Mooncake 분리형 서빙 아키텍처는 일반적인 코딩 워크로드에서 캐시 적중률 90% 이상을 유지합니다——실제 대부분의 호출 비용은 $0.30대에 가깝습니다.
API 액세스 등록: platform.kimi.ai에서 키를 생성하고 base_url을 https://api.moonshot.ai/v1, 모델 ID를 kimi-k3로 설정합니다.
LICENSE 검토: Hugging Face 가중치 다운로드 전 법무팀이 MaaS 매출 또는 MAU 게이트 적용 여부를 확인합니다.
OpenAI SDK 호환 통합: 대부분의 기존 프로젝트는 base URL과 API 키만 변경하면 됩니다.
캐시 프리픽스 최적화: system prompt와 도구 정의 프리픽스를 재사용——코딩 에이전트는 90%+ 캐시율이 가능하며 실효 입력 비용은 $0.30/M로 내려갑니다.
셀프호스팅 하드웨어 확인: 64장 이상 가속 카드 슈퍼노드 용량을 확인합니다. 대부분 팀에게는 OpenRouter 등(이미 7개 프로바이더 가동)이 현실적입니다.
추론 스택 선택: vLLM(KDA + prefix caching) 또는 SGLang으로 배포합니다. FlashKDA는 chunk_kda 백엔드 직접 대체로 사용할 수 있습니다.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "이 코드의 복잡도를 분석해 주세요..."}]
)미중 AI 분쟁 맥락과 세 가지 핵심 수치
Kimi K3 오픈 웨이트 공개는 WAIC 2026과 겹치며 미중 「모델 증류」 분쟁 격화 직후에 이뤄졌습니다. 백악관 과학 고문 Michael Kratsios가 Moonshot의 Anthropic Fable 대상 대규모 증류를 비난했고 재무장관 Scott Bessent가 제재를 시사했습니다. 중국 상무부는 7월 28일 「AI 패권주의」로 반격했습니다. K3 공개 3일 후 Alibaba가 Qwen3.8-Max-Preview를 발표했으며, K3에 대한 직접 대응으로 널리 해석되어 오픈 웨이트 경쟁이 「3T 클럽」 단계에 진입했습니다.
2.8T / 오픈 웨이트 1위: 지금까지 완전 공개된 최대 오픈 웨이트 모델——Hugging Face 약 1.56TB, 30분 내 트렌드 1위.
93.4% / 세계 3위: SWE-bench Verified 독립 점수 93.4%, AA Index 약 57——종합 3위, 오픈 웨이트 1위.
11일 / 인프라 3종: API 출시부터 전체 가중치 공개까지 11일, MoonEP·FlashKDA·AgentEnv 동시 오픈.
실용적 대안에도 숨은 비용이 있습니다: 개인 Mac에서 Kimi Code 에이전트 실행은 절전·네트워크 끊김에 취약합니다; 전체 K3 셀프호스팅에는 64장 이상 가속 카드가 필요하며 대부분 팀은 감당하기 어렵습니다; 단일 폐쇄 API 의존은 K3의 100만 토큰 정액 가격 이점을 살리기 어렵습니다. 프로덕션 iOS CI/CD와 7×24 AI 에이전트 자동화에는 KVMNODE 전용 Mac Mini M4 클라우드 대여가 보통 더 적합합니다: 네이티브 Apple Silicon, 전체 sudo, 일/주/월 유연 과금. 가격 페이지, 고객 센터, 또는 바로 주문을 참고하세요.
데이터 기준: 2026년 7월 28일 · 출처: Moonshot AI 공식 블로그, Hugging Face, GitHub moonshotai/FlashKDA, Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index