Claude Opus 5.5을(를) SeedRouter에서 사용할 수 있습니다

Kimi K3 파라미터 수, 컨텍스트 윈도우, 최대 출력 토큰

Kimi K3 스펙: 파라미터 2.8조 개, 토큰마다 896개 전문가 중 16개 활성화, 1M 토큰 컨텍스트 윈도우, 최대 1,048,576 출력 토큰까지 정리했습니다.

Markdown으로 읽기

Kimi K3는 2.8조 개의 파라미터를 가지며, 토큰마다 896개 전문가 중 16개를 활성화합니다. 컨텍스트 윈도우는 1,048,576 토큰이고, 응답 하나의 길이는 최대 1,048,576 토큰까지 가능하지만 기본 한도는 131,072입니다. Moonshot AI는 이 모델을 "세계 최초의 3조 파라미터급 오픈소스 모델"이라고 부르며 전체 가중치를 공개했습니다. 항상 추론하며, 텍스트와 이미지를 읽고 텍스트를 씁니다.

Kimi K3 스펙 한눈에 보기

스펙값
개발사Moonshot AI
총 파라미터2.8조
전문가896개, 토큰마다 16개 활성화
아키텍처Kimi Delta Attention과 Attention Residuals를 적용한 전문가 혼합(MoE)
컨텍스트 윈도우1,048,576 토큰
최대 출력1,048,576 토큰, 추론 포함
기본 출력 한도131,072 토큰
추론항상 켜짐; low, high, max(기본값 max)
입력텍스트와 이미지(이미지는 base64만)
출력텍스트
가중치Moonshot AI가 공개
SeedRouter 모델 IDkimi-k3

Kimi K3의 파라미터 수는 얼마인가요?

2.8조 개입니다. Moonshot AI의 빠른 시작 문서는 Kimi K3를 "2.8조 개의 파라미터를 갖춘, 지금까지 가장 뛰어난 플래그십 모델"이자 "2.8조 파라미터에 도달한 최초의 오픈소스 모델"이라고 소개합니다.

Kimi K3의 활성 파라미터는 몇 개인가요?

Moonshot AI의 빠른 시작 문서는 활성 파라미터 수를 밝히지 않습니다. 대신 이 모델이 Stable LatentMoE 프레임워크를 통해 "896개 전문가 중 16개를 효율적으로 활성화"한다고 설명합니다. 즉 2.8조 개 파라미터 중 작은 일부만 각 토큰을 처리하므로 토큰당 연산량이 줄어듭니다. 그래도 모든 가중치를 메모리에 올려야 하므로, Kimi K3를 직접 실행하려면 멀티 GPU 데이터센터급 하드웨어가 필요합니다.

Kimi K3는 어떤 아키텍처를 사용하나요?

두 가지 어텐션 변경 위에 구축된 전문가 혼합(MoE) 모델입니다. Moonshot AI의 표현으로는 "하이브리드 선형 어텐션 메커니즘인 Kimi Delta Attention(KDA)과 Attention Residuals를 기반으로 구축"되었습니다. Moonshot AI는 이러한 변경이 더 희소한 전문가 구성, 새로운 학습 방법과 함께 Kimi K3에 "K2 대비 약 2.5배의 전반적 스케일링 효율"을 준다고 말합니다. 자세한 내용은 Kimi K3 기술 보고서에서 공개될 예정입니다.

Kimi K3 컨텍스트 윈도우는 얼마인가요?

1,048,576 토큰으로, 보통 1M으로 표기합니다. 프롬프트, 이미지, 대화 기록, 응답이 모두 이 하나의 윈도우를 공유합니다.

Kimi K3 최대 출력 토큰은 얼마인가요?

요청당 최대 1,048,576 토큰이며, max_completion_tokens로 설정합니다. 기본값은 131,072입니다. Moonshot AI의 빠른 시작 문서: "max_completion_tokens의 기본값은 131072이며 최대 1048576까지 설정할 수 있습니다."

알아 둘 점이 두 가지 있습니다.

  • 추론도 한도에 포함됩니다. Kimi K3는 항상 추론하며, 추론 토큰은 답변과 같은 예산을 사용합니다.
  • max_tokens는 같은 한도의 지원 중단된 이름입니다. max_completion_tokens를 사용하세요.

응답이 중간에 잘리면 max_completion_tokens를 올리거나, 사고에 쓰이는 예산이 줄도록 reasoning_effort를 낮추세요. API 형식별로 잘린 응답을 알아보는 방법은 컨텍스트 윈도우와 최대 출력 토큰의 차이에서 설명합니다.

Kimi K3의 추론을 끌 수 있나요?

아니요. Kimi K3는 항상 추론합니다. reasoning_effort를 low, high, max 중 하나로 설정할 수 있으며, 기본값인 max는 가장 느리고 출력 토큰을 가장 많이 씁니다. 대부분의 작업에는 high가, 빠르고 단순한 단계에는 low가 적합합니다. 추론은 content 옆의 reasoning_content로 반환되며 출력 토큰으로 과금됩니다.

어떤 설정이 고정되어 있나요?

Moonshot AI는 Kimi K3의 샘플링을 temperature 1.0, top_p 0.95, n 1, presence_penalty 0, frequency_penalty 0으로 고정합니다. 다른 값을 넣으면 오류가 반환되므로, 요청에서 이 필드들은 빼 두세요.

Kimi K3는 이미지를 읽을 수 있나요?

네, 다만 base64 data URI로만 가능합니다. 공개 이미지 URL은 받지 않으며, Kimi 자체 API와 마찬가지로 400을 반환합니다. 출력은 항상 텍스트입니다.

Kimi K3는 어떻게 호출하나요?

SeedRouter에서 Kimi K3는 같은 키와 모델 ID kimi-k3로 OpenAI Chat Completions, OpenAI Responses, Anthropic Messages 형식을 모두 받습니다. 첫 요청은 Kimi K3 API 가이드에서 따라 할 수 있고, 테스트를 거친 설정은 Claude Code와 Codex 설정 가이드에, 모든 파라미터는 Kimi K3 API 레퍼런스에 있습니다. 실시간 요금은 Kimi K3 페이지에서 확인하세요.

자주 묻는 질문

Kimi K3는 얼마나 큰가요?

총 2.8조 개 파라미터이며, 토큰마다 896개 전문가 중 16개가 활성화됩니다.

Kimi K3는 오픈소스인가요?

Moonshot AI는 전체 모델 가중치를 공개했습니다. 직접 실행하는 데 무엇이 필요한지는 Kimi K3는 무료인가요?에서 다룹니다.

Kimi K3가 131,072 토큰에서 멈추는 이유는 무엇인가요?

그것이 기본 출력 한도이기 때문입니다. 더 긴 응답이 필요하면 max_completion_tokens를 최대 1048576까지 설정하세요.

Kimi K3는 누가 만들었나요?

Kimi 어시스턴트를 만든 중국 기업 Moonshot AI입니다.

관련 가이드