
Kimi K3 리뷰: Moonshot의 2.8T 오픈 모델 vs Fable 5 및 GPT-5.6 Sol
최종 확인일: 2026년 7월 17일. 아래의 모든 사양, 가격 및 벤치마크 수치는 이 글이 게시된 당일 Moonshot의 플랫폼 문서, Artificial Analysis 및 독립적인 보도 자료를 통해 다시 한번 검증되었습니다. Kimi K3는 2026년 7월 16일에 출시되었습니다.
이번 Kimi K3 리뷰에서 가장 주목할 만한 숫자는 하나입니다. Moonshot의 새로운 모델이 Arena의 프론트엔드 코드(Frontend Code) 리더보드에서 1위로 데뷔했으며, 이는 Kimi K2.6 대비 17계단 상승한 순위로 Claude Fable 5보다 높은 위치입니다. 이는 블라인드 매치업에서 실제 개발자들의 심사를 받은 프론트엔드 코딩 대회에서 중국의 오픈 가중치 모델이 승리했다는 것을 의미합니다. 내부를 살펴보면, 토큰당 896개의 전문가(Expert) 중 단 16개만 작동시키는 2.8조 파라미터 규모의 혼합 전문가(Mixture-of-Experts, MoE) 설계이며, 백만 토큰의 컨텍스트를 읽고 입력 가격은 백만 토큰당 $0.30에서 $3.00 사이입니다. 기대하기 전에 알아야 할 함정은 다음과 같습니다. 아직 가중치를 다운로드할 수 없으며, Moonshot은 이 상황이 7월 27일에 변경될 것이라고 밝혔습니다.
간단한 결론:
- 정체성: Moonshot AI의 플래그십 모델로, 2.8T 파라미터 MoE 모델이며 100만 토큰 컨텍스트, 네이티브 이미지 및 비디오 입력, 항상 켜져 있는 추론 기능을 제공합니다. API ID는
kimi-k3입니다. - 강점: 에이전트 브라우징(BrowseComp 91.2) 및 장기적 코딩 작업(SWE Marathon 42.0, Fable 5와 GPT-5.6 Sol 모두 초과). Arena 프론트엔드 코드 아레나에서 1위.
- 약점: FrontierSWE 및 HLE-Full(Fable 5가领先), DeepSWE(GPT-5.6 Sol이领先). 독립 기관인 Artificial Analysis는 전체 189개 모델 중 4위로 평가했습니다.
- 비용: 캐시 히트 시 입력 $0.30 / 신규 입력 $3.00, 출력 $15.00 (백만 토큰 기준). 중국 연구소가 출시한 모델 중 가장 비쌉니다.
- 주의사항: 명목상 오픈 가중치이지만, 체크포인트는 2026년 7월 27일까지 공개되지 않습니다. 그 전까지는 자체 호스팅이 불가능하며 독립적인 제3자 평가도 이루어질 수 없습니다.
한 줄 요약이 필요하다면: Kimi K3는 클로즈드 소스 최첨단 모델과 실제로 맞붙을 수 있는 최초의 오픈 가중치 모델이지만, 가중치 출시가pending 상태인 출시 초기 소프트웨어이며 프리미엄 가격이 부과됩니다. 이하에서는 사양, 벤치마크 현실(모든 숫자를 해석하는 방식에 영향을 주는 주의사항 포함), 가격 계산, 그리고 실제로 누구에게 적합한지 자세히 살펴보겠습니다.
Kimi K3란 무엇인가?
Kimi K3는 2026년 7월 16일 출시된 Moonshot AI의 최신 대규모 언어 모델입니다. 총 2.8조 개의 파라미터를 가진 혼합 전문가(MoE) 모델로, 각 토큰 처리 시 896개의 전문가 중 단 16개만 활성화하므로 밀집형(dense) 2.8T 모델이 요구하는 것보다 훨씬 낮은 토큰당 연산 비용을 유지합니다. 텍스트, 이미지, 비디오를 수용하며 100만 토큰의 컨텍스트 창을 보유하고, 추론 기능이 기본적으로 항상 켜져 있습니다.
사양표를 한눈에 살펴보면 다음과 같습니다.
| 사양 | Kimi K3 |
|---|---|
| 출시일 | 2026년 7월 16일 |
| 개발사 | Moonshot AI |
| 총 파라미터 수 | 2.8조 (혼합 전문가, MoE) |
| 토큰당 활성 전문가 | 896개 중 16개 |
| 어텐션 메커니즘 | Kimi Delta Attention (KDA), 100만 토큰 컨텍스트에서 최대 6.3배 빠른 디코딩 |
| 컨텍스트 창 | 1,000,000 토큰 |
| 지원 모달리티 | 텍스트, 이미지, 비디오 입력 |
| 추론 기능 | 항상 활성화; 출시 당시 단일 "max" 레벨 제공 |
| API 모델 ID | kimi-k3 (OpenAI-SDK 호환) |
| 가중치 | 오픈 가중치; 2026년 7월 27일 공개 예정 |
| 백만 토큰당 가격 | 캐시 히트 시 $0.30 또는 신규 입력 $3.00, 출력 $15.00 |
흥미로운 엔지니어링 스토리는 어텐션 설계에 있습니다. Moonshot은 이를 Kimi Delta Attention(KDA)이라고 부르며, 회사가 보고한 바에 따르면 백만 토큰 컨텍스트에서 최대 6.3배 더 빠른 디코딩 속도를 제공하는 하이브리드 선형 어텐션 메커니즘입니다. K3는 여기에 Attention Residuals, Gated MLA, Stable LatentMoE라는 새로운 기법들을 결합했습니다. 약어를 암기할 필요는 없습니다. 이들이 합쳐져 이루는 것은 거대한 컨텍스트를 유지하면서도 속도를 유지할 수 있는 모델이며, 이는 기존 아키텍처가 무너지던 정확히 그 workload를 해결합니다.
K3를 이전 모델과 비교하면 도약 폭이 큽니다. Kimi K2(약 1T) 대비 파라미터 수가 거의 3배 증가(2.8T)했고, K2.6 및 K2.7 라인(256K) 대비 컨텍스트 창이 4배 확대(100만)되었으며, 텍스트 중심이었던 기존 패밀리에 이미지 및 비디오 입력이 추가되었습니다. 이전 Kimi 모델을 사용해 보고 실망했다면, 이번에는 완전히 다른 차원의 모델입니다.
Kimi K3 벤치마크: 승리와 패배의 지점
Kimi K3의 출시 벤치마크 결과는 genuinely 강력하면서도 mixed된 양상을 보입니다. 일부 코딩 및 에이전트 작업에서는 필드를 선도하지만, 다른 영역에서는 클로즈드 소스 최첨단 모델들에 명확히 뒤처집니다. 표를 보기 전에 어떤 단일 점수보다 중요한 주의사항이 하나 있습니다. Moonshot은 각 모델을 자사의 코딩 환경 내에서 실행했습니다. K3는 KimiCode에서, Fable 5는 Claude Code에서, GPT-5.6 Sol은 Codex에서 점수가 측정되었습니다. 모델을 감싸는 소프트웨어가 결과에 영향을 미치므로, 이러한 수치는 확정된 리더보드라기보다 방향성을 나타내는 지표로 읽어야 합니다.
다음은 Moonshot의 출시 표에서 주요 코딩 및 에이전트 수치입니다.
| 벤치마크 | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Program Bench | 77.8 | 77.6 | 76.8 |
| SWE Marathon | 42.0 | 39.0 | 35.0 |
| Terminal-Bench 2.1 | 88.3 | 88.8 | 84.6 |
| DeepSWE | 67.5 | 73.0 | 70.0 |
| FrontierSWE | 81.2 | 71.3 | 86.6 |
| BrowseComp | 91.2 | 미발표 | 미발표 |
| OmniDocBench | 91.1 | 미발표 | 미발표 |
행(row)을 가로지르며 패턴을 읽어보면, K3는 길고 끈질긴 작업에서 승리합니다. 수 시간에 걸친 지속적인 엔지니어링 세션을 측정하는 SWE Marathon에서 K3의 42.0점은 GPT-5.6 Sol과 Fable 5를 명확한 격차로 앞서갑니다. Program Bench에서도 근소한 차이로 필드를 리드하며, 에이전트 측면에서도 BrowseComp 91.2, OmniDocBench 91.1로 선도합니다(Moonshot은 Automation Bench에서도 1위라고 보고했습니다).
어디서 패배할까요? DeepSWE에서는 GPT-5.6 Sol이 73.0으로 앞섭니다. FrontierSWE에서는 Fable 5가 86.6으로 확실한 우위를 보이지만, K3의 81.2점 역시 Sol의 71.3점보다는 높다는 점을 지적할 가치가 있습니다. Moonshot의 자체 표에서도 K3가 FrontierSWE와 HLE-Full에서는 Fable 5에, DeepSWE에서는 GPT-5.6 Sol에 뒤처진다고 인정합니다. 이는 모든 분야에서 최첨단을 압도하는 모델이 아닙니다. 하지만 오픈 가중치 릴리스로서는 이전에 없던 방식으로 특정 영역에서 최첨단을 이기는 모델입니다.
독립적인 평가도 이를 뒷받침합니다. Artificial Analysis는 K3의 인텔리전스 지수를 57점으로 평가하며 189개 모델 중 4위로ランク했습니다. Claude Fable 5와 두 가지 GPT-5.6 Sol 추론 설정에는 뒤처졌지만 Claude Opus 4.8보다는 앞섭니다. 측정된 출력 속도는 비교적 modest한 초당 62토큰입니다. 인간 선호도 측면에서 Arena의 프론트엔드 코드 아레나에서 K3가 1위를 차지한 것이 눈에 띄는데, 이는 자체 보고 점수가 아니라 실제 프론트엔드 출력물에 대한 개발자들의 투표에서 나온 순위이기 때문입니다.
독립 개발자인 Simon Willison은 출시 당일 his pelican-on-a-bicycle SVG test를 통해 K3를 테스트했습니다. 모델은 견고한 결과를 생성했고 자체 이미지에 대한 정확한 대체 텍스트(alt text)를 작성했는데, 이는 비전 능력에 대해 긍정적인 신호입니다. 그는 또한 가격 섹션에서 다룰 비용 충격에 대해 지적했으며, 빠른 SVG 테스트는 에이전트 도구 호출(agentic tool calling)에 대해서는 아무것도 알려주지 않는다는 점을 독자들에게 상기시켰습니다. 공정한 경고입니다.
Kimi K3 vs Fable 5, GPT-5.6 Sol, DeepSeek 및 Qwen
그렇다면 K3는 광범위한 필드에서 어디에 위치할까요? 두 가지 비교가 중요합니다. 클로즈드 소스 최첨단 모델들과의 비교, 그리고 다른 중국 오픈 가중치 모델들과의 비교입니다.
최첨단 모델들과 비교할 때, 정직한 표현은 "최첨단에 인접했지만 최정상은 아니다"입니다. Claude Fable 5와 GPT-5.6 Sol은 여전히 집계 인텔리전스 순위에서 leading position을 유지하며, Fable 5는 가장 어려운 추론 및 프론티어 코딩 평가에서 실질적인 우위를 유지합니다. K3로 인해 변화한 점은 카테고리 간의 간극이 아닌, 단일 벤치마크 수준의 접전으로 격차가 좁아졌다는 것입니다. 다운로드 가능한 모델이 SWE Marathon을 주도하고 블라인드 프론트엔드 코딩 투표에서 1위를 차지하는 것은 새로운 지평입니다.
오픈 가중치 동료 모델들과 비교할 때, K3는 순수 성능 측면에서 새로운 최고 수준(high-water mark)이지만 모든 작업에 대한 очевид한 기본 선택지는 아닙니다. 중국 오픈 가중치 옵션들을 그룹으로 고려한다면, 우리의 Qwen vs DeepSeek vs GLM 비교 기사에서 이 세 패밀리가 시장을 어떻게 나누는지 설명합니다. Qwen은 가장 가벼운 자체 호스팅 풋프린트와 허용적인 라이선스를, DeepSeek은 가장 저렴한 토큰 가격을, GLM은 실습 코딩을 강점으로 합니다. K3는 이제 피크 벤치마크와 가격 면에서 이들 모두 위에 위치합니다. 저렴함으로 명성을 쌓았던 카테고리에서 프리미엄 옵션이 된 것입니다.
GPT-4급 품질을 실제로 능가하는 모델들을 포함한 더 넓은 필드를 위해, 우리의 2026년 최고의 오픈소스 LLM roundup 기사는 K3의 주장을 맥락화합니다. 요약하자면, K3는 오픈 가중치의 상한선을 높였지만, "오픈 가중치"와 "저렴함"은 공식적으로 같은 의미가 아니게 되었습니다.
Kimi K3 가격 및 캐시 히트 계산
여기서 K3에 대한 의견이 분분해집니다. Moonshot은 K3의 가격을 캐시 히트 입력 토큰 백만 개당 $0.30, 신규 입력 토큰 백만 개당 $3.00, 출력 토큰 백만 개당 $15.00으로 책정했으며, 이는 전체 백만 토큰 컨텍스트에 걸쳐 균일하게 적용됩니다.
이를 이전 모델과 나란히 놓으면 변화가 극명합니다.
| 토큰 유형 | Kimi K3 | Kimi K2.6 |
|---|---|---|
| 입력 (신규) | $3.00 / M | $0.95 / M |
| 입력 (캐시 히트) | $0.30 / M | 미공개 |
| 출력 | $15.00 / M | $4.00 / M |
이는 K2.6 대비 입력 가격은 약 3배, 출력 가격은 거의 4배 상승한 것입니다. Willison은 $3/$15 요금이 Claude Sonnet과 동일한 티어에 해당한다고 지적했습니다. The Decoder는 K3가 초저가 중국 AI 시대의 종말을 알리는 신호라고 불렀습니다. 중국 모델을 사용하는 주된 이유가 가격이었다면, K3는 당신을 다시 생각하게 만들 것입니다.
하지만 실제 청구액을 결정하는 숫자는 캐시 히트율입니다. Moonshot의 공개 요율을 사용하여 현실적인 에이전트 루프에 대한 계산을 해보겠습니다. 코딩 에이전트가 200,000토큰의 코드베이스 컨텍스트를 읽고 8,000토큰의 출력을 작성하며, 이를 하루에 20번 수행한다고 가정해 봅시다.
- 캐시 미스 (첫 번째 콜드 리드): $3.00/M 기준 200,000 입력 토큰은 $0.60, $15.00/M 기준 8,000 출력 토큰은 $0.12입니다. 호출당 약 $0.72, 하루 $14.40입니다.
- 캐시 히트 (반복되는 컨텍스트, 코딩 세션에서의 일반적인 경우): $0.30/M 기준 200,000 입력 토큰은 $0.06, 동일한 $0.12의 출력 비용이 추가됩니다. 호출당 약 $0.18, 하루 $3.60입니다.
캐시 경제학은 입력 비용을 호출당 $0.60에서 $0.06으로 약 10배 절감시킵니다. Moonshot은 코딩 워크로드에서 90% 이상의 캐시 히트율을 보고하는데, 이는 K3를 부담스러운 가격이 아닌 합리적인 가격으로 만드는 시나리오입니다. 예산 교훈: K3는 콜드 원샷 호출에서는 비싸지만, 웜(warm) 상태의 컨텍스트 중심 루프 내에서는 합리적입니다.
Willison이 드러낸 또 다른 비용 함정이 있습니다. K3는 현재 단일 "max" 추론 레벨만 노출하며, 추론 토큰은 출력 요율로 청구됩니다. 그의 간단한 SVG 테스트는 3,417개의 출력 토큰 외에 13,241개의 추론 토큰을 소모하여, 사소한 프롬프트에 약 25센트의 비용이 들었습니다. 아직 저렴한 "low reasoning" 모드가 없으므로, K3는 쉬운 질문에도 과도하게 비용을 지불합니다. 비용 통제가 우선순위라면, LLM API 가격 비교 및 LLM API 비용 절감 가이드 기사가 여기에 직접적으로 적용됩니다. 적극적으로 캐싱하고, 사소한 호출은 더 저렴한 모델로 라우팅하며, K3는 프리미엄 가격을 정당화하는 어렵고 긴 컨텍스트 작업에만 예약하십시오.
오픈 가중치: 여기서 "오픈"이 실제로 의미하는 것
출시 헤드라인이 간과한 부분입니다. Kimi K3는 오픈 가중치 모델로 발표되었으며, Moonshot은 다운로드 가능한 체크포인트를 출시한 확실한 실적을 가지고 있습니다. 그러나 2026년 7월 17일 현재 K3 가중치는 공개되지 않았습니다. Moonshot의 Hugging Face 조직에는 여전히 K2 시리즈 체크포인트만 나열되어 있습니다. 회사는 전체 가중치가 2026년 7월 27일에 도착한다고 밝혔습니다.
이 공백이 왜 중요할까요? 세 가지 실질적인 이유가 있습니다.
- 현재 자체 호스팅 불가. 가중치가 공개되기 전까지 자체 하드웨어나 프라이빗 클러스터에서 K3를 실행할 수 없습니다. 데이터 거주성 또는 에어갭 요구 사항이 있는 팀의 경우, 현재 K3는 API 전용이며 이는 오픈 모델을 선택하는 주요 이유 중 하나를 무효화합니다. 가중치가 공개되면, 로컬에서 LLM을 실행하기 위한 최고의 도구 및 로컬에서 LLM 실행 가이드 기사가 도움이 될 것입니다. 다만 2.8T 파라미터 모델은 노트북 클래스가 아닌 클러스터 클래스 하드웨어가 필요합니다.
- 아직 독립적인 평가 없음. 지금까지 본 모든 K3 벤치마크는 벤더가 Moonshot의 자체 환경에서 실행한 것입니다. HLE 또는 에이전트 특정 작업과 같은 심각한 제3자 수치는 외부 연구소가 테스트할 가중치를 확보해야만 존재할 수 있습니다. 출시 표를 검증된 결과라기보다 강력한 주장으로 취급하십시오.
- 라이선스 조항이 아직 확정 중. 이전 Kimi 릴리스는 허용적인 라이선스를 사용했지만, 체크포인트가 공개될 때 공식 모델 카드에서 정확한 K3 라이선스를 확인해야 합니다. 특히 상업적 배포를 계획하는 경우 더욱 그렇습니다.
이것이 K3의 인상 깊음을 감소시키지는 않습니다. 다만 모델을 다운로드하고 파인튜닝하는 것에 계획이 의존한다면, 실제 평가는 7월 16일이 아닌 7월 27일부터 시작된다는 것을 의미합니다.
고객 작업을 위해 Kimi K3를 평가하는 방법
이 리뷰의 출처와 한계에 대한 간단한 노트입니다. Techsy에서는 B2B 고객을 위해 서드파티 LLM을 프로덕션 파이프라인에 연결하며, 일반적으로 OpenAI-SDK 호환 엔드포인트를 통해 플럼빙(plumbing)을 재구축하지 않고도 모델을 교체할 수 있도록 합니다. K3는 이 경로에 깔끔하게 부합합니다. 모델 ID kimi-k3로 OpenAI 호환 API를 노출하므로, 기존 통합에 드롭인하여 시험해 보는 것은 재작성이 아닌 구성 변경으로 가능합니다.
새로운 모델이 출시될 때마다, 우리는 무엇을 추천하기 전에 고객 대표 작업에 대해 동일한 고정 평가를 수행합니다. 그리고 이 리뷰의 정직한 한계는 다음과 같습니다. 우리는 아직 자체 K3 점수를 공개하지 않습니다. 가중치가 나오지 않았고, 출시 벤치마크는 Moonshot의 자체 환경에서 벤더가 실행한 것이며, 공정한 점수는 리더보드가 아닌 실제 고객 작업처럼 보이는 작업에 대한 중립적인 설정이 필요합니다. 출시 하루 만에 가중치 pending 상태인 모델의 제1자 벤치마크를 인용하는 것은 우리가 고객들에게 신뢰하지 말라고 조언하는 종류의 숫자와 정확히 일치합니다.
오늘 라이브 API에서 평가할 수 있는 부분은 리더보드가 필요 없는 부분입니다. 즉, 통합 표면, 비용 모델 및 실패 모드입니다. 위의 가격 계산은 벤치마크가 아닌 Moonshot의 공개 요율로부터의 자체 계산이며, 이는 이미 운영상의 진실을 알려줍니다. 캐시 규율이 K3를 합리적으로 만들지 예산 문제로 만들지를 결정합니다. K3와 같은 모델이 스택에 적합한지 판단하는 데 도움이 필요하다면, 그것은 Techsy의 AI 통합 실무에서 수행하는 평가 유형이며, 이에 대해 논의하려면 무료 상담을 예약할 수 있습니다.
Kimi K3를 사용해야 하는 사람 (및 사용하지 않아야 하는 사람)
Kimi K3는 특정 작업군에는 강력한 적합성을 보이지만 다른 작업에는 부적합합니다. 실제 워크로드에 맞추십시오.
K3를 선택해야 하는 경우:
- 에이전트 브라우징 또는 연구를 수행하는 경우. BrowseComp 및 Automation Bench에서의 선두 위치와 독립적인 에이전트 연구 평가에서 최상위를 기록했으므로, 현재 도구를 사용하는 에이전트를 위한 가장 유능한 오픈 가중치 옵션입니다.
- 장기적 코딩 작업을 수행하는 경우. SWE Marathon은 수 시간에 걸친 엔지니어링 세션을 반영하는 벤치마크이며, K3가 이를 주도합니다. 에이전트가 큰 코드베이스에서 장기간 작동한다면 이곳이 K3의 본거지입니다.
- 오픈 가중치 최첨단 인접 모델이 필요하며 가중치 공개를 기다릴 수 있는 경우. 7월 27일에 최상위 오픈 모델을 자체 호스팅하는 것이 목표라면, K3는 이용 가능한 가장 유능한 후보입니다.
대기해야 하는 경우:
- 오늘 당장 가중치가 필요한 경우. 7월 27일까지 K3는 API 전용입니다. 이미 다운로드 가능한 모델이 이번 주에는 더 나은 선택입니다.
- 고용량, 비용 민감 트래픽을 처리하는 경우. 단일 고가 추론 레벨과 프리미엄 출력 가격으로 인해, K3는 단순 호출에서 과도한 비용을 지불합니다. 대량 작업에는 Kimi K2.7-Code 또는 더 저렴한 오픈 모델이 승리합니다.
- 도입 전에 입증된 독립적인 평가가 필요한 경우. 출시 숫자는 벤더가 실행한 것입니다. 프로세스가 제3자 검증을 요구한다면 몇 주를 기다리십시오.
자주 묻는 질문
Kimi K3란 무엇인가요?
Kimi K3는 2026년 7월 16일 출시된 Moonshot AI의 플래그십 대규모 언어 모델입니다. 토큰당 896개 중 16개의 전문가를 활성화하는 2.8조 파라미터 혼합 전문가(MoE) 모델로, 100만 토큰 컨텍스트 창을 지원하며 텍스트, 이미지, 비디오 입력을 수용하고 추론 기능이 항상 켜져 있습니다.
Kimi K3는 오픈소스인가요?
Kimi K3는 오픈 가중치 모델로 발표되었지만, 2026년 7월 17일 현재 가중치는 공개되지 않았습니다. Moonshot은 전체 체크포인트가 2026년 7월 27일에 출시될 것이라고 밝혔습니다. 그 전까지는 Kimi 앱과 API를 통해서만 이용 가능하므로, 아직 자체 호스팅은 불가능합니다.
Kimi K3는 Kimi K2와 어떻게 다른가요?
K3는 K2의 파라미터 수를 거의 3배 증가시켰으며(2.8조 대 약 1조), K2.6 및 K2.7 라인의 컨텍스트 창을 4배 확대했습니다(100만 대 256K 토큰). 또한 이전에는 텍스트 중심이었던 패밀리에 네이티브 이미지 및 비디오 입력을 추가했습니다. 새로운 Kimi Delta Attention 설계도 도입되었습니다.
Kimi K3의 가격은 얼마인가요?
Moonshot은 K3의 가격을 캐시 히트 입력 토큰 백만 개당 $0.30, 신규 입력 토큰 백만 개당 $3.00, 출력 토큰 백만 개당 $15.00으로 책정했습니다. 이는 K2.6의 입력 가격의 약 3배, 출력 가격의 거의 4배에 달하며, K3를 중국 연구소가 출시한 모델 중 가장 비싼 모델로 만듭니다.
Kimi K3의 컨텍스트 창은 얼마나 되나요?
Kimi K3는 100만 토큰의 컨텍스트 창을 지원하며, 가격은 전체 창에 걸쳐 균일하게 유지됩니다. 모델은 Kimi Delta Attention이라는 새로운 어텐션 설계를 사용하며, Moonshot은 이것이 백만 토큰 컨텍스트 길이에서 최대 6.3배 더 빠른 디코딩을 제공한다고 보고합니다.
Kimi K3를 로컬에서 실행할 수 있나요?
아직은 아닙니다. 가중치는 2026년 7월 27일까지 공개되지 않습니다. 그 이후에는 기술적으로 자체 호스팅이 가능하지만, 2.8조 파라미터 모델은 단일 워크스테이션이 아닌 클러스터 클래스 하드웨어가 필요하므로 대부분의 팀은 여전히 API를 통해 접근할 것입니다.
Kimi K3는 정말 Fable 5보다 낫나요?
작업에 따라 다릅니다. K3는 SWE Marathon, Program Bench 및 Arena의 블라인드 프론트엔드 코딩 투표에서 Claude Fable 5를 이깁니다. Fable 5는 여전히 FrontierSWE, HLE-Full 및 전체 집계 인텔리전스 순위에서 leading position을 유지합니다. 모든 출시 벤치마크는 각 벤더의 자체 환경에서 실행되었으므로, 단일 벤치마크 승리는 방향성 지표로 취급하십시오.
Kimi K3는 코딩에 좋은가요?
네, 특히 현재 leading position을 차지하고 있는 길고 지속적인 코딩 세션 및 프론트엔드 작업에 좋습니다. 에이전트 및 터미널 작업에서도 강점을 보입니다. 주요 단점은 비용입니다. 하나의 고가 추론 레벨로 인해 사소한 호출에서 과도한 비용을 지불하므로, 고용량 일상 작업에는 더 저렴한 모델과 함께 사용하십시오.
Kimi K3에 어떻게 접근하나요?
Kimi 웹 앱, Kimi Work 및 Kimi Code를 통해或使用 model id kimi-k3로 API를 통해 Kimi K3를 사용할 수 있습니다. API는 OpenAI-SDK와 호환되므로, 기존 OpenAI 스타일 통합에 추가하는 것은 주로 구성 변경 사항입니다.
저자 소개
Mert Batur Gurbuz, 공동 창업자, Techsy.io (버밍엄 대학교). LinkedIn에서 연결하세요.
Mert Batur Gurbuz는 Techsy.io의 공동 창업자로, 팀은 B2B 고객을 위해 AI 에이전트, 자동화 시스템 및 음성/SDR 파이프라인을 구축합니다. 그는 버밍엄 대학교에서 공부하며, Techsy 팀이 프로덕션에서 실제로 사용하는 LLM 툴링 스택에 대해 글을 씁니다.
주요 요약
- Kimi K3는 클로즈드 소스 최첨단 모델과 실제로 맞붙을 수 있는 최초의 오픈 가중치 모델입니다. SWE Marathon을 주도하고 Claude Fable 5보다 높은 Arena의 블라인드 프론트엔드 코딩 투표에서 1위를 차지했습니다.
- 최첨단에 인접했지만 최정상은 아닙니다. 독립 기관 Artificial Analysis는 189개 모델 중 4위로 평가했으며, 가장 어려운 추론 및 프론티어 코딩 테스트에서는 Fable 5에 뒤처집니다.
- 명목상 오픈이지만 실제로는 pending 상태입니다. 가중치는 2026년 7월 27일까지 공개되지 않으므로, 그 전까지는 자체 호스팅과 독립적인 평가가 불가능합니다.
- 가격은 저가 중국 AI 시대를 종식시켰습니다. 백만 토큰당 $3/$15의 가격에서 캐시 규율이 K3를 합리적으로 만드는 열쇠입니다. 콜드 원샷 호출이 아닌 웜 상태의 컨텍스트 중심 루프를 위해 예산을 수립하십시오.
- 에이전트 연구 및 장기적 코딩에 최적입니다. 오늘 당장 가중치가 필요하거나 비용 민감한 고용량 트래픽을 처리한다면, 대기하거나 더 저렴한 모델을 선택하십시오. 결정에 도움이 필요하면 저희에게 연락하십시오.