
Kimi K3 완벽 가이드: Moonshot 2.8T 플래그십
Kimi K3 사양, 구조, 가격과 API 동작을 정리합니다: 1M 컨텍스트, 상시 추론, 고정 샘플링, OpenAI 호환 API 호출 방법.
Moonshot AI는 2026년 7월 중순 Kimi K3를 출시했지만 순서는 일반적인 발표와 반대였습니다. API 문서, 가격 페이지, 실제 작동하는 kimi-k3 모델 ID가 벤치마크 표, 기술 블로그, 가중치 공개보다 먼저 나타났습니다[1]. 일주일 동안 유출 글이 정보 공백을 채웠지만 널리 퍼진 내용 대부분은 적어도 한 부분이 틀렸습니다. 이 가이드는 Moonshot 자체 문서를 바탕으로 확인된 것, 의도적으로 고정된 것, 아직 공개되지 않은 것을 구분합니다.
관점도 분명합니다. reAPI는 reAPI 게이트웨이에서 Kimi K3를 제공합니다. 따라서 아래에서는 모델 설명뿐 아니라 실제 호출 방식, 요청을 거부하게 만드는 파라미터, 요금을 좌우하는 캐시 동작, K2.x 코드가 마이그레이션할 때 만나는 함정을 다룹니다.
핵심 요약
- Kimi K3는 2.8조 파라미터 플래그십으로, 하이브리드 선형 어텐션인 Kimi Delta Attention과 Attention Residuals를 사용합니다. Stable LatentMoE는 token마다 896개 전문가 중 16개를 활성화합니다[1][3].
- 컨텍스트 창은 1,048,576 tokens이며 가격은 동일합니다. 긴 컨텍스트 추가 티어는 없습니다. Moonshot 네이티브 API의 출력 한도 기본값은 131,072이며 최대 1,048,576까지 설정할 수 있지만, 입력과 요청한 한도의 합이 창 안에 들어가야 합니다[1][2][9].
- 추론은 항상 켜져 있습니다. 조정 수단은 3단계
reasoning_effort(low/high/max,medium없음)뿐이며 기본값은max입니다[4]. - 샘플링은 고정됩니다.
temperature1.0,top_p0.95,n1, 두 penalty 0이며 다른 값을 보내면 오류가 납니다[1]. - Moonshot 공식 요금은 1M tokens당 입력 $3.00 / 출력 $15.00이고 캐시 적중 입력은 $0.30입니다. reAPI의 같은 모델은 $2.50 / $12.00으로 두 항목 모두 더 낮습니다[2][8].
- 이미지와 영상 입력을 네이티브 지원하지만 공개 이미지 URL은 거부합니다. base64 또는 업로드한 파일 참조만 가능합니다[5].
Kimi K3 한눈에 보기
다음 표는 2026년 7월 26일 확인한 Moonshot API 문서의 내용입니다.
| 사양 | Kimi K3(공식) |
|---|---|
| 모델 ID | kimi-k3 |
| 전체 파라미터 | 2.8조 |
| 아키텍처 | Kimi Delta Attention(하이브리드 선형 어텐션) + Attention Residuals, Stable LatentMoE, 896개 중 16개 전문가 활성 |
| 컨텍스트 창 | 1,048,576 tokens(1M) |
| 최대 출력 | 네이티브 API 기본값 131,072 tokens, 매개변수 상한 1,048,576. 입력과 한도의 합이 컨텍스트 안에 들어가야 함 [9] |
| 모달리티 | 텍스트, 이미지, 영상 입력, 텍스트 출력 |
| 추론 | 항상 켜짐, reasoning_effort의 low / high / max, 기본 max |
| 입력 가격(캐시 미적중) | 1M tokens당 $3.00 |
| 입력 가격(캐시 적중) | 1M tokens당 $0.30 |
| 출력 가격 | 1M tokens당 $15.00 |
| 컨텍스트 티어 | 없음. 길이와 무관하게 token 단가 동일 |
두 숫자는 다시 볼 가치가 있습니다. 2.8T 파라미터는 지금까지 오픈 웨이트 모델이 없던 영역입니다. Moonshot은 가중치 공개를 약속했으며, 실현되면 3조 파라미터급 최초 오픈 소스 모델이 됩니다[3]. 가격도 중요합니다. $3.00 / $15.00이면 K3는 K2 계열보다 3~4배 비쌉니다. Moonshot은 과거 Kimi가 의미하던 가성비 모델이 아니라 최전선 플래그십으로 가격을 정했습니다. 그래도 폐쇄형 최전선 모델보다 입력과 출력 모두 저렴합니다.
출시 순서: API가 먼저, 기술 자료는 나중
출시 순서를 알면 여전히 상충하는 정보가 도는 이유를 이해할 수 있습니다. 발표 전 커뮤니티 추적자들은 Moonshot 플랫폼에 잠깐 나타난 홍보 페이지와 Kimi 앱의 beta 선택기를 발견했습니다. 유출 정보는 “약 2.5T 파라미터, 1M 컨텍스트”로 모였습니다. 가깝지만 공식 수치는 2.8T입니다. Moonshot 공식 계정의 무자막 티저 영상이 뒤따랐고 제품은 보도 주기를 앞질렀습니다. API 문서, 빠른 시작, 가격 페이지가 최초 금융 보도와 같은 날 공개됐습니다[1][2].
API와 문서를 벤치마크 및 가중치보다 먼저 공개한 순서는 첫날 기술 블로그와 오픈 웨이트를 함께 제공한 K2 플래그십과 반대입니다. 실제로 K3 첫 주에는 문서만 신뢰할 수 있는 출처였고 나머지는 추론이었습니다.
아키텍처: Kimi Delta Attention, LatentMoE, Attention Residuals
K3 문서에서 기술적으로 가장 흥미로운 문장은 모델이 “하이브리드 선형 어텐션인 Kimi Delta Attention과 Attention Residuals를 기반으로 한다”는 설명입니다[3]. 홍보 문구가 아니라 Moonshot이 2025년 말 발표한 Kimi Linear 연구를 실제 배포한 것입니다. 이를 이해하면 1M-token 창과 그 창을 쓸 수 있게 하는 고정 요금을 이해할 수 있습니다[6].
**Kimi Delta Attention(KDA)**은 더 세밀한 게이팅을 적용한 Gated DeltaNet 개선형 선형 어텐션입니다. 표준 softmax 어텐션은 시퀀스 길이에 따라 키-값 캐시가 선형으로 늘어나 100만 token 컨텍스트의 서비스 비용이 매우 높습니다. 선형 어텐션은 대신 고정 크기 순환 상태를 유지합니다. 과거의 대가는 품질이었습니다. 순수 선형 어텐션은 긴 문서에서 정확한 내용을 회상하는 능력이 약했습니다.
하이브리드 배치는 Kimi Linear 논문이 이 절충을 해결한 방법입니다. KDA와 전체 어텐션 레이어를 3:1로 교차해 네 레이어 중 세 개는 저렴한 선형 방식을, 네 번째는 정확한 전역 어텐션을 사용합니다. 발표 결과에서 이 구성은 품질 벤치마크의 전체 어텐션을 앞서면서 KV-cache 메모리를 최대 75% 줄이고 1M-token 컨텍스트에서 디코딩을 최대 6x 빠르게 했습니다[6].
Stable LatentMoE는 희소 Mixture-of-Experts 구성입니다. 전문가 896개 중 token마다 16개가 활성화됩니다[3]. 이 희소성이 2.8T 모델을 실제로 서비스할 수 있게 합니다. token당 활성 연산은 전체 파라미터 중 작은 부분입니다.
Attention Residuals는 아직 공개 논문이 없는 유일한 구성 요소입니다. 이 용어는 K3 문서에서 처음 등장했습니다. 기술 보고서가 나오기 전에는 이름만 알고 작동 원리는 모른다는 것이 정확한 입장입니다.
실무에서 중요한 이유는 1M-token 컨텍스트가 경제적으로 가능해야 가치가 있기 때문입니다. 초장문을 제공하는 대다수 공급자는 가격 티어를 높이거나 조용히 품질을 낮춥니다. K3 문서는 티어가 없다고 밝힙니다. 5,000 tokens나 900,000 tokens나 동일한 token 요율을 적용합니다[2]. 긴 컨텍스트의 한계 비용이 실제로 크게 낮아져야만 이 가격이 합리적이며 KDA의 목적이 바로 그것입니다. 아키텍처가 가격을 설명합니다.
API가 실제로 제공하는 기능
K3 API는 K2.x 또는 OpenAI형 모델에서 이전하는 팀이 놀랄 만큼 명확한 제약을 둡니다. 다음은 관찰이 아니라 문서에 명시된 조건입니다[1].
- 추론은 항상 켜져 있습니다. 비사고 모드는 없습니다. Moonshot FAQ도 “사고 과정을 끄는 법”에 불가능하다고 답합니다. 최상위
reasoning_effort는low,high,max3단계이며medium은 없습니다. 기본은 가장 비싼max입니다[4]. - 샘플링은 고정입니다.
temperature1.0,top_p0.95,n1, 두 penalty 0입니다. 다른 값은 오류이므로 요청에서 생략해야 합니다. 작업마다 temperature를 조절하던 파이프라인은 그 수단을 잃습니다. - 출력 예산은 입력과 같은 창에 들어가야 합니다. Moonshot 네이티브 API의
max_completion_tokens기본값은 131,072이며 최대 1,048,576까지 설정할 수 있습니다. 입력과 요청 한도의 합이 컨텍스트 창을 넘으면invalid_request_error가 반환됩니다. 최대 설정값이 100만 token의 최종 답변을 보장하지는 않습니다. 입력, 추론, 답변 공간을 고려해 한도를 명시하세요[9]. - 스트리밍은 추론과 답변을 나눕니다. 응답은
reasoning_contentdelta와contentdelta를 따로 보내 UI가 사고 과정과 최종 답을 분리해 표시할 수 있습니다. - Preserved Thinking이 필수입니다. 멀티턴과 도구 루프에서는
reasoning_content와tool_calls를 포함한 assistant 메시지 전체를 바꾸지 않고messages에 다시 넣어야 합니다. OpenAI형 코드에서 흔한content만 보존하는 방식은 조용히 성능을 떨어뜨립니다. - 비전 입력에 제약이 있습니다. 이미지와 영상은 네이티브지만 공개 이미지 URL은 안 됩니다. base64 data URI를 보내거나 파일을 업로드한 후 ID로 참조합니다[5].
- 구조화 출력은 정식 기능입니다.
strict: true를 포함한 JSON Schema가 최종 답변 필드를 제한하지만 산문 추론은 제한하지 않습니다.
새로운 도구 호출 스택
K3에서 두 기능이 처음 등장했습니다. 모두 도구가 많은 에이전트가 정의만으로 컨텍스트를 소모하는 문제를 해결합니다[1].
**tool_choice: "required"**는 해당 턴에 최소 한 번의 도구 호출을 강제합니다. 검색해야 할 때 기억만으로 답하는 것을 막습니다. K2 모델은 이 값을 거부하지만 K3는 받습니다.
동적 도구 로딩은 더 새로운 방식입니다. 대화 중간의 system 메시지에 완전한 도구 정의를 넣습니다. tools 필드는 있고 content는 없어야 하며 그 시점부터 도구가 활성화됩니다. 매 요청에 80개 스키마를 먼저 넣는 대신 워크플로가 필요한 순간 주입합니다. 주의할 점은 서버가 동적 도구를 보관하지 않는다는 것입니다. system 메시지를 요청 기록에 남기지 않으면 다음 턴에 사라집니다.
문서의 경고도 반복할 가치가 있습니다. Moonshot 내장 web_search는 업데이트 중으로 표시되며 현재 프로덕션 사용을 권장하지 않습니다. 검색이 필요하면 직접 연결해야 합니다.
자동 컨텍스트 캐시
K3 캐시는 ID, TTL 관리, 추가 파라미터가 필요 없습니다. 긴 접두사를 요청마다 안정적으로 유지하면 플랫폼이 자동으로 캐시 적중을 시도하며, 1M tokens당 $3.00이 아닌 $0.30을 청구합니다[1]. 반복 컨텍스트에 90% 할인이 적용되어 1M 창을 데모가 아닌 실무 패턴으로 만듭니다. 코퍼스를 안정 접두사로 한 번 불러온 뒤 10분의 1 가격으로 반복 질의할 수 있습니다.
적중 조건은 두 가지입니다. 이전 요청의 prompt tokens가 256을 넘어야 하고, 그보다 적으면 저장되지 않습니다. reasoning_effort 단계도 바꾸면 안 됩니다. 대화 중 변경하면 접두사 캐시가 무효화됩니다[4]. 대화를 시작하기 전에 단계를 선택하세요.
초기 제3자 데이터도 이를 뒷받침합니다. OpenRouter의 K3 실시간 통계는 전체 트래픽의 캐시 적중률이 75%를 넘었고, 가중 평균 입력 가격을 정가의 3분의 1 아래로 낮췄습니다[7].
가격: 가성비 전략과의 의도적 결별
지금까지 Kimi 출시는 주로 가격으로 경쟁했지만 K3는 다릅니다. 다음은 자체 제품군과 최전선 경쟁 모델의 위치입니다. 1M tokens 기준이며 입력은 캐시 미적중 요금입니다.
| 모델 | 입력 | 출력 | 캐시 적중 입력 | 컨텍스트 |
|---|---|---|---|---|
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K3(Moonshot 직접) | $3.00 | $15.00 | $0.30 | 1M |
| reAPI의 Kimi K3 | $2.50 | $12.00 | — | 1M |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 1M |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
포지셔닝은 명확합니다. K3는 자체 형제 모델보다 3~4배 비싸고 폐쇄형 최전선 모델보다 40–50% 저렴합니다. Moonshot은 1M-token 창, 네이티브 영상 입력, 최전선급 능력이 오픈 웨이트 시장의 프리미엄 티어를 정당화한다고 판단합니다.
속도는 솔직히 덧붙여야 할 조건입니다. 초기 제3자 측정은 초당 약 28 tokens, 첫 token까지 약 4초를 보여 줍니다[7]. 이 규모의 상시 추론 모델이라면 놀랍지 않지만 느립니다. K3는 분당 호출 수가 아니라 호출당 깊이를 위해 설계됐습니다. 지연에 민감한 상호작용은 다른 모델이 낫습니다.
제품군 정리도 진행됩니다. 기존 moonshot-v1 계열과 오래된 K2.x 변형은 신규 사용자에게 닫혔고, 2026년 8월 말 전체 플랫폼 종료가 예고됐습니다. Moonshot은 모두를 K3로 옮기려 합니다.
K2.x에서 마이그레이션하기
현재 K2.6이나 K2.7-Code를 쓴다면 변경 범위는 작지만 실제 작업이 필요합니다.
- 모델 ID를
kimi-k3로 변경합니다. API는 OpenAI 호환을 유지합니다. thinking파라미터를 최상위reasoning_effort로 교체합니다. K2의thinking객체는 K3 파라미터가 아니며 오류가 납니다.- 샘플링 파라미터를 제거합니다. K3 요청에서
temperature,top_p, penalty 설정을 빼세요. 서버에 고정되어 다른 값은 거부됩니다. - 추론 단계를 의도적으로 정합니다. 기본
max가 가장 비싸고 추론 tokens는 출력으로 청구됩니다. 필요하지 않으면high나low를 사용하고 캐시를 깨지 않도록 대화 중에는 바꾸지 않습니다. - 비용 모델을 다시 검토합니다. 정가 기준 출력 token은 K2.6의 3.75x이고 상시 추론이 출력량도 늘립니다. 안정 접두사는 앞, 가변 접미사는 뒤에 두어 자동 캐시를 활용하세요.
- 공개 이미지 URL을 사용했다면 비전 입력을 변경합니다. K3는 base64 또는 업로드한 파일 참조만 받습니다[5].
- 모든 멀티턴에서 assistant 메시지를 완전하게 반환합니다.
reasoning_content와tool_calls를 포함해야 합니다.
지금 K3를 써야 하는 사용자
확인된 정보만 보면 K3는 token당 비용보다 작업당 품질이 중요한 장기 작업에 맞습니다. 대형 저장소를 몇 시간 탐색하는 코딩 에이전트, 캐시 접두사에 반복 질의하는 100만 token 문서 코퍼스, 이미지·영상·코드를 한 컨텍스트에서 처리하는 멀티모달 추론 등입니다.
지연에 민감한 대화형 제품에는 맞지 않습니다. 28 tokens/sec는 다른 목적의 도구입니다. 모든 값이 고정되어 샘플링 조정이 필요한 파이프라인에도, 순수 비용 최적화에도 적합하지 않습니다. 후자는 더 저렴한 티어의 역할입니다.
reAPI에서 Kimi K3 실행하기
K3는 reAPI 게이트웨이에 OpenAI 호환 교체형 엔드포인트로 제공됩니다. base URL을 https://api.reapi.ai/v1로 바꾸고 게이트웨이 키를 bearer token으로 보내며 모델을 kimi-k3로 설정하세요. 기존 openai SDK가 그대로 작동합니다.
curl https://api.reapi.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [
{ "role": "user", "content": "Refactor this module and add tests." }
],
"reasoning_effort": "high",
"stream": true
}'K3를 직접 연결하지 않고 reAPI로 라우팅할 이유는 두 가지입니다.
- 가격. reAPI K3는 1M tokens당 입력 $2.50 / 출력 $12.00으로 Moonshot 공식 가격보다 두 항목 모두 낮고 출력은 5분의 1 저렴합니다[8]. 상시 추론으로 출력량이 늘어나는 모델에서는 출력 요금이 중요합니다.
- 한 키로 여러 모델. 같은 게이트웨이 키로 Claude, GPT, Gemini, DeepSeek, GLM, Kimi 계열을 호출합니다. K3는 공급자 종속이 아니라 라우팅 선택이 되며 다른 모델과 동일한 폴백 및 부하 분산 로직에 넣을 수 있습니다.
고정 파라미터, 캐시 조건, 비전 파트 형식, 오류 목록을 포함한 전체 인터페이스는 Kimi K3 API 문서에 있고 현재 요금은 모델 페이지에서 확인할 수 있습니다.
자주 묻는 질문
Kimi K3는 오픈 소스인가요?
Moonshot은 K3를 오픈 소스 출시라고 설명하고 가중치 공개를 약속했습니다. 실현되면 3조 파라미터급 최초 오픈 모델이 됩니다[3]. 작성 시점에 공개가 임박했지만 주된 접근 경로는 API입니다.
K3 추론을 끄거나 줄일 수 있나요?
끌 수 없으며 항상 켜져 있습니다. reasoning_effort로 low, high, max 중 선택해 줄일 수 있고 기본값은 max입니다[4]. low는 추론 비용이 답변 가치보다 클 때를 위한 단계입니다.
1M 컨텍스트는 추가 요금이 있나요?
없습니다. 길이와 무관하게 token 단가는 동일하고, 900K-token prompt와 9K의 요율이 같습니다[2]. Moonshot 직접 연결에서는 캐시 적중 입력이 1M tokens당 $0.30입니다.
K3 요청에 temperature 오류가 나는 이유는 무엇인가요?
temperature, top_p, n, 두 penalty 파라미터는 서버에 고정되며 다른 값은 덮어쓰기 대신 오류가 됩니다[1]. 요청에서 삭제하세요. K2의 thinking 객체도 마찬가지이며 최상위 reasoning_effort를 사용해야 합니다.
Claude Code, Codex, Cline에서 K3를 쓸 수 있나요?
가능합니다. API가 OpenAI 호환이므로 사용자 base URL과 키를 받는 Claude Code, Codex, Cline, RooCode, OpenCode에서 사용할 수 있습니다. 게이트웨이 키로 https://api.reapi.ai/v1을 가리키고 모델 ID를 kimi-k3로 설정하세요.
벤치마크에서 K3는 Claude Opus 4.8이나 GPT-5.5와 어떻게 비교되나요?
작성 시점까지 Moonshot은 K3 공식 평가표를 공개하지 않았습니다. SWE-Bench도 Terminal-Bench도 독립 검증 가능한 결과도 없습니다. 벤치마크 표와 기술 보고서가 나오기 전에는 소셜 미디어의 구체적인 수치를 미검증 정보로 봐야 합니다.
참고 자료
- Moonshot AI. Kimi K3 빠른 시작 — 모델 ID, 고정 샘플링, 출력 한도, 도구 호출, 캐시 공식 API 문서. 2026년 7월 platform.kimi.ai/docs/guide/kimi-k3-quickstart에서 확인
- Moonshot AI. Kimi K3 가격 — 1M tokens당 $3.00 / $15.00, 캐시 입력 $0.30, 컨텍스트 티어 없음. 2026년 7월 platform.kimi.ai/docs/pricing/chat-k3에서 확인
- Moonshot AI. 모델 개요 — 2.8T, Kimi Delta Attention + Attention Residuals, Stable LatentMoE(896개 중 16개), 오픈 소스 약속. 2026년 7월 platform.kimi.ai/docs/api/models-overview에서 확인
- Moonshot AI. reasoning_effort 사용 — 3단계(low / high / max), 기본 max, 변경 시 캐시 무효화. 2026년 7월 platform.kimi.ai/docs/guide/use-reasoning-effort에서 확인
- Moonshot AI. Kimi 비전 모델 사용 — 이미지·영상 입력, base64와 파일 참조, 공개 URL 불가. 2026년 7월 platform.kimi.ai/docs/guide/use-kimi-vision-model에서 확인
- Moonshot AI. Kimi Linear: An Expressive, Efficient Attention Architecture(arXiv:2510.26692) — KDA, 3:1 하이브리드, KV-cache와 디코딩 결과. 2026년 7월 arxiv.org/abs/2510.26692에서 확인
- OpenRouter. MoonshotAI: Kimi K3 — 캐시 적중률, 가중 입력 가격, 처리량, TTFT 실시간 통계. 2026년 7월 openrouter.ai/moonshotai/kimi-k3에서 확인
- reAPI. Kimi K3 — 모델 페이지, API 문서, 현재 요금. 2026년 7월 reapi.ai/docs/kimi-k3에서 확인
- Moonshot AI. Chat Completions API — output cap and input-plus-cap validation. Retrieved September 8, 2026 from platform.kimi.ai/docs/api/chat
더 읽을거리
- reAPI. Kimi K3 API 문서. reapi.ai/docs/kimi-k3
- reAPI. Kimi K3 모델 페이지 — 현재 가격. reapi.ai/models/kimi-k3
- reAPI. Claude Opus 4.8이란? Anthropic 새 모델 설명. reapi.ai/blog/what-is-claude-opus-4-8
- reAPI. reAPI란? reapi.ai/blog/what-is-reapi
작성자

카테고리
더 많은 게시물

Seedance 2.0 API 가격 비교 2026: 가성비 실측
동일 조건의 Seedance 2.0 API 가격을 reAPI, Atlas, Replicate, fal, WaveSpeed에서 비교하고 현재 요금과 소스 영상 과금 규칙을 설명합니다.


Seedance 2.0 초당 비용: 실제 과금 방식
해상도와 등급별 Seedance 2.0 초당 비용, 업로드 비디오에만 적용되는 할인 요금과 이로 인한 예산 예측 실수를 설명합니다.


Qwen Image 2 API: 가격, 텍스트 렌더링, 편집 (2026)
Qwen Image 2 API로 이미지 생성 및 편집하기. 현재 가격, 지원 비율, 프롬프트 제한, reAPI 파라미터, 안전성, 코드를 알아보세요.
