Claude Opus 5.5을(를) SeedRouter에서 사용할 수 있습니다

Kimi K3 API 요금: 100만 토큰당 가격, 캐시, 작업당 비용

Kimi K3 API 100만 토큰당 요금: 입력, 출력, 캐시된 입력, 5분 또는 1시간 캐시 쓰기 요금과 과금 공식, 작업 1건의 비용까지 정리했습니다.

Markdown으로 읽기

Kimi K3는 토큰 단위로 과금되며, 입력, 출력, 캐시된 입력, 캐시 쓰기에 각각 별도의 요금이 있습니다. 요금은 프롬프트 길이에 따라 달라지지 않습니다. 90만 토큰 프롬프트도 900 토큰 프롬프트와 같은 토큰당 요금을 냅니다. 가장 비싼 것은 출력이고, Kimi K3는 항상 추론하므로 추론 토큰도 비용을 내는 출력에 포함됩니다. SeedRouter에는 구독이 없으며, 실패한 요청에는 요금이 부과되지 않습니다.

아래 표는 계정에 과금하는 요금표에서 그대로 읽어 오므로, 오늘 요청 한 건의 비용을 보여 줍니다.

Kimi K3는 100만 토큰당 얼마인가요?

Kimi K3

Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.

캐시된 입력은 반복되는 프롬프트 앞부분을 캐시에서 읽을 때의 요금입니다. 두 개의 캐시 쓰기 열은 앞부분을 캐시에 쓰는 요금으로, 캐시에 머무는 시간에 따라 나뉩니다.

Moonshot의 공식 요금은 얼마인가요?

참고로, Moonshot AI가 직접 정한 Kimi K3 요금 구조를 요금 페이지에서 가져왔습니다. 각 항목은 입력 요금의 배수입니다.

항목입력 대비 배수
입력(캐시 미스)1×
캐시된 입력(캐시 히트)0.1×
캐시 쓰기, 5분 TTL1×
캐시 쓰기, 1시간 TTL2×
출력5×

위의 실시간 표에는 SeedRouter의 항목별 요금이 나와 있으며, Kimi K3 페이지에서는 이를 Moonshot의 공식 요금과 나란히 보여 줍니다.

Kimi K3 요청은 어떻게 과금되나요?

모든 응답은 usage에 토큰 수를 보고하며, 요금은 이를 따릅니다.

  • prompt_tokens: 캐시에서 읽거나 캐시에 쓴 부분을 포함한 프롬프트 전체.
  • prompt_tokens_details.cached_tokens: 캐시에서 읽은 부분.
  • prompt_tokens_details.cache_write_tokens: 캐시에 쓴 부분.
  • completion_tokens: 답변과 추론.

요금은 다음과 같습니다.

cost = ( (prompt - cached - cache writes) × input rate
       + cached × cached-input rate
       + cache writes × cache-write rate for the TTL
       + completion × output rate ) / 1,000,000

Kimi K3 작업 1건은 얼마인가요?

작업이 읽고 쓰는 토큰 수에 따라 달라지며, 추론 강도는 출력 쪽을 크게 바꿉니다. 같은 짧은 질문으로 테스트했을 때 low는 출력 토큰 25개, max는 146개를 사용해, 같은 프롬프트에서 출력이 거의 6배였습니다. 예시로 든 세 가지 작업 규모(단위: 토큰)는 다음과 같습니다.

작업입력출력
low 강도의 짧은 질문약 100약 30
high 강도로 파일 하나 코드 리뷰약 5,000약 1,500
대규모 저장소에서의 에이전트 한 단계약 200,000, 대부분 캐시약 3,000

각 값에 위의 실시간 요금을 곱하면 됩니다. 토큰당 출력 요금은 입력의 5배이므로, 보통 추론과 답변이 청구액을 좌우합니다. 같은 저장소를 반복해서 읽는 에이전트라면 캐시 히트로 입력 쪽 비용이 10분의 1로 줄어듭니다.

Kimi K3 토큰 1,000개는 얼마인가요?

토큰 1,000개의 비용은 100만 토큰당 요금을 1,000으로 나눈 값입니다. Moonshot은 토큰 하나를 대략 영문 3~4자로 보므로, 1,000 토큰은 수천 자 분량의 텍스트입니다. 캐시된 입력 요금으로는 새 입력의 10분의 1입니다.

5분 캐시와 1시간 캐시 중 무엇을 써야 하나요?

캐싱은 자동입니다. 기본적으로 기록된 앞부분은 5분 동안 유지되며, 히트할 때마다 갱신됩니다. 요청 간격이 벌어져 있다면 prompt_cache_options.ttl을 1h로 설정하세요.

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=messages,
    prompt_cache_options={"mode": "implicit", "ttl": "1h"},
)

1시간 쓰기는 입력 요금의 2배, 5분 쓰기는 1배입니다. 요청 간격이 5분을 넘는다면, 한 시간 안에 세 번 이상 읽히는 앞부분은 1시간 TTL이 더 저렴합니다. 2× 쓰기 1회와 0.1× 히트 2회(2.2×) 대 5분 쓰기 3회(3×)입니다.

Kimi K3를 더 저렴하게 쓰는 방법이 있나요?

출력이 청구액의 대부분을 차지하므로 추론 강도를 낮추는 것이 가장 큰 효과를 냅니다. 길고 반복해서 쓰는 컨텍스트는 프롬프트 앞부분에 두어 캐시에서 읽히도록 하세요. Kimi K3의 가중치는 공개되어 있지만, 2.8조 파라미터 모델을 직접 운영하려면 데이터센터급 하드웨어가 필요하며, 이는 사용량이 매우 많을 때만 이득입니다.

자주 묻는 질문

Kimi K3는 긴 프롬프트에 더 많은 요금을 받나요?

아니요. Kimi K3는 토큰당 단일 요금을 적용하며, 긴 컨텍스트 요금 구간이 없습니다.

Kimi K3 구독이 있나요?

SeedRouter에는 없습니다. 잔액을 충전하고 토큰 단위로 결제합니다. Moonshot 자체 API도 토큰 단위로 과금하며, 첫 충전 후에만 Kimi K3를 활성화합니다.

실패한 요청도 과금되나요?

아니요. 오류를 반환한 Kimi K3 요청에는 요금이 부과되지 않습니다.

어떻게 시작하나요?

Kimi K3 API 가이드에서 키 발급과 첫 호출 방법을 안내합니다.

관련 가이드