프로덕션에서 Kimi K3를 검토한다면, 먼저 확인할 것은 파라미터 수가 아니라 Moonshot AI의 공개가 진정한 오픈소스인지 여부입니다. 2026년 7월 27일 저녁, 이 중국 연구소는 2.8조 파라미터 MoE 모델의 전체 가중치와 100만 토큰 컨텍스트를 공개했으며, MoonEP·FlashKDA·AgentEnv 인프라 세 가지도 함께 오픈했습니다. 본문에서는 11일 릴리스 타임라인, KDA / AttnRes / Per-Head Muon 아키텍처, SWE-bench 및 AA Index 벤치마크, 두 가지 상업 라이선스 게이트, 6단계 배포 체크리스트를 다룹니다. 배경: K3 오픈 웨이트 선행 가이드, 증류 논쟁.
01

Kimi K3는 오픈소스인가, 아니면 오픈 웨이트인가?

짧은 답: 엄격한 정의로는 아닙니다——Moonshot AI도 그렇게 주장하지 않습니다. 2026년 7월 27일 Moonshot은 Kimi K3의 전체 가중치와 기술 보고서를 공개했습니다. 이는 2.8조 파라미터 Mixture-of-Experts 모델로 네이티브 시각 이해를 지원합니다. 약 1.56TB 다운로드는 Hugging Face에서 30분 이내 트렌드 1위를 기록했으며, K3는 지금까지 완전 공개된 최대 오픈 웨이트 모델입니다.

날짜마일스톤핵심 내용
7월 16일API 출시Kimi App / Work / Code / API 가동, 가중치 미공개
7월 17일WAIC 2026국영 매체가 파라미터 수 기준 세계 최대 오픈 모델로 보도
7월 22–23일증류 분쟁백악관 과학 고문 Kratsios가 Moonshot의 Anthropic Fable 대상 산업 규모 증류 비난
7월 27일전체 가중치 공개완전 가중치 + 기술 보고서 + MoonEP / AgentEnv(FlashKDA는 선행 공개)
7월 28일상무부 대응중국 상무부가 워싱턴의 「AI 패권주의」 비난
01

오픈 웨이트와 오픈소스 혼동: Moonshot은 「open source」라고 말하지 않으며, 학습 데이터와 전체 학습 코드는 비공개입니다.

02

라이선스 게이트 과소평가: K3에는 MaaS 매출 2,000만 달러 임계값과 1억 MAU 귀속 표시 의무가 추가되었으며 K2 패밀리에는 없었습니다.

03

소비자 하드웨어로 구동 가능하다고 가정: 2.8T 파라미터, 896 전문가——Moonshot은 64장 이상 가속 카드 슈퍼노드를 권장합니다.

04

파라미터만 쫓고 비용 무시: K3는 오픈 웨이트 역량 상한이지만 작업당 약 $0.95로 GLM-5.2(약 $0.47)보다 비쌉니다.

05

지정학적 컴플라이언스 무시: 미중 증류 분쟁과 WAIC 2026 시점이 겹쳐 기업 구매에 공급망 리스크가 더해집니다.

02

Kimi K3 사양과 아키텍처: KDA, AttnRes, Per-Head Muon

사양
총 파라미터2.8조
활성 파라미터약 1,040억
전문가 구성896 라우팅 전문가, 토큰당 16 활성화(희소성 약 1.8%)
어텐션Kimi Delta Attention(KDA) + Gated Multi-Head Latent Attention(MLA)
컨텍스트 윈도우1,000,000 토큰
멀티모달네이티브 비전(ViT-V2, 27층)
가중치 형식MXFP4 가중치, MXFP8 활성화(SFT부터 양자화 인식 학습)
다운로드 크기약 1.56TB(Hugging Face)
라이선스커스텀——Moonshot은 「open weight」라 부르며 「open source」는 아님

Kimi Delta Attention(KDA)는 단일 스칼라 망각 게이트를 채널별 게이팅으로 대체합니다. 각 특징 차원이 독립 감쇠율을 가지며 chunkwise DPLR로 선형 시간 재귀를 구현합니다. K3는 KDA와 Gated MLA 층을 교차 배치——100만 토큰 윈도우와 최소 KV 캐시의 핵심입니다.

Attention Residuals(AttnRes)는 균일 잔차 누적을 선택적·입력 의존 동적 집계로 대체합니다——파라미터 2% 미만 증가로 학습 효율 약 25% 향상합니다.

Per-Head Muon은 각 어텐션 헤드를 독립 최적화합니다. Stable LatentMoE는 Quantile Balancing을 사용하며 MoonEP가 계산 랭크별 중복 전문가 상한을 수학적으로 증명합니다.

구성 요소해결 과제핵심 이점
KDA장시퀀스 KV 캐시 폭발선형 시간 재귀, 최소 VRAM
AttnRes깊은 층에서 초기 신호 희석학습 효율 약 25% 향상
Per-Head Muon헤드 간 균일 옵티마이저적은 활성 파라미터로 프론티어급 결과
Stable LatentMoE대규모 MoE 전문가 부하 불균형896 중 16 활성——희소성 1.8%
03

세 가지 인프라 공개와 벤치마크: GPT-5.6, Claude, GLM-5.2 비교

기술역할핵심 수치
MoonEP초대규모 MoE 통신과부하 전문가 복제, 랭크별 중복 전문가 상한 증명
FlashKDACUTLASS KDA 커널H20에서 prefill flash-linear-attention 대비 1.72×–2.22× 빠름
AgentEnvFirecracker microVM 에이전트 샌드박스checkpoint 약 133ms, 재개 약 49ms, 메모리 오버커밋 최대 6.5배

SWE-bench Verified(독립 평가, Vals AI, 2026년 7월):

모델점수출시일
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
GLM-5.2(max)51(AA Index)이전 오픈 웨이트 1위

Artificial Analysis Intelligence Index(max 추론)에서 Kimi K3는 약 57점——종합 3위, 오픈 웨이트 1위입니다. 오픈 웨이트 티어의 역량 상한이지만 작업당 약 $0.95로 GLM-5.2(약 $0.47)보다 비쌉니다. 현재 Arena.ai Frontend Code Arena 1위입니다.

04

상업 라이선스 게이트와 6단계 배포 체크리스트

Moonshot은 일관되게 「오픈 웨이트」 공개라 부르며 「오픈소스」라고 하지 않습니다. 라이선스는 완전 커스텀 문서이며 K2 패밀리에 없던 두 가지 상업 임계값이 있습니다:

게이트트리거요건
MaaS 매출 게이트Model-as-a-Service 매출이 지난 12개월 2,000만 달러 초과Moonshot AI와 별도 상업 계약
귀속 표시 게이트월간 활성 사용자 1억 초과 또는 월 매출 2,000만 달러 초과제품 UI에 「Kimi K3」 눈에 띄게 표시
토큰 유형백만 토큰당 가격
입력(캐시 적중)$0.30
입력(캐시 미스)$3.00
출력(추론 트레이스 포함)$15.00

Mooncake 분리형 서빙 아키텍처는 일반적인 코딩 워크로드에서 캐시 적중률 90% 이상을 유지합니다——실제 대부분의 호출 비용은 $0.30대에 가깝습니다.

01

API 액세스 등록: platform.kimi.ai에서 키를 생성하고 base_urlhttps://api.moonshot.ai/v1, 모델 ID를 kimi-k3로 설정합니다.

02

LICENSE 검토: Hugging Face 가중치 다운로드 전 법무팀이 MaaS 매출 또는 MAU 게이트 적용 여부를 확인합니다.

03

OpenAI SDK 호환 통합: 대부분의 기존 프로젝트는 base URL과 API 키만 변경하면 됩니다.

04

캐시 프리픽스 최적화: system prompt와 도구 정의 프리픽스를 재사용——코딩 에이전트는 90%+ 캐시율이 가능하며 실효 입력 비용은 $0.30/M로 내려갑니다.

05

셀프호스팅 하드웨어 확인: 64장 이상 가속 카드 슈퍼노드 용량을 확인합니다. 대부분 팀에게는 OpenRouter 등(이미 7개 프로바이더 가동)이 현실적입니다.

06

추론 스택 선택: vLLM(KDA + prefix caching) 또는 SGLang으로 배포합니다. FlashKDA는 chunk_kda 백엔드 직접 대체로 사용할 수 있습니다.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "이 코드의 복잡도를 분석해 주세요..."}]
)
05

미중 AI 분쟁 맥락과 세 가지 핵심 수치

Kimi K3 오픈 웨이트 공개는 WAIC 2026과 겹치며 미중 「모델 증류」 분쟁 격화 직후에 이뤄졌습니다. 백악관 과학 고문 Michael Kratsios가 Moonshot의 Anthropic Fable 대상 대규모 증류를 비난했고 재무장관 Scott Bessent가 제재를 시사했습니다. 중국 상무부는 7월 28일 「AI 패권주의」로 반격했습니다. K3 공개 3일 후 Alibaba가 Qwen3.8-Max-Preview를 발표했으며, K3에 대한 직접 대응으로 널리 해석되어 오픈 웨이트 경쟁이 「3T 클럽」 단계에 진입했습니다.

A

2.8T / 오픈 웨이트 1위: 지금까지 완전 공개된 최대 오픈 웨이트 모델——Hugging Face 약 1.56TB, 30분 내 트렌드 1위.

B

93.4% / 세계 3위: SWE-bench Verified 독립 점수 93.4%, AA Index 약 57——종합 3위, 오픈 웨이트 1위.

C

11일 / 인프라 3종: API 출시부터 전체 가중치 공개까지 11일, MoonEP·FlashKDA·AgentEnv 동시 오픈.

실용적 대안에도 숨은 비용이 있습니다: 개인 Mac에서 Kimi Code 에이전트 실행은 절전·네트워크 끊김에 취약합니다; 전체 K3 셀프호스팅에는 64장 이상 가속 카드가 필요하며 대부분 팀은 감당하기 어렵습니다; 단일 폐쇄 API 의존은 K3의 100만 토큰 정액 가격 이점을 살리기 어렵습니다. 프로덕션 iOS CI/CD와 7×24 AI 에이전트 자동화에는 KVMNODE 전용 Mac Mini M4 클라우드 대여가 보통 더 적합합니다: 네이티브 Apple Silicon, 전체 sudo, 일/주/월 유연 과금. 가격 페이지, 고객 센터, 또는 바로 주문을 참고하세요.

데이터 기준: 2026년 7월 28일 · 출처: Moonshot AI 공식 블로그, Hugging Face, GitHub moonshotai/FlashKDA, Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index