Claude Opus 5.5을(를) SeedRouter에서 사용할 수 있습니다
LogoSeedRouter

모델 이름으로 검색 (예: nano banana)

모델 이름으로 검색 (예: nano banana)

Grok 4.7 요금: 캐시된 입력, 추론과 요청 비용

Grok 4.7 요금과 캐시된 입력, 추론 사용량을 알아봅니다. 현재 토큰 단가로 캐시 토큰을 중복 계산하지 않고 요청 비용을 추산합니다.

Markdown으로 읽기

Grok 4.7 요금은 입력 토큰, 캐시된 입력과 출력 사용량에 따라 결정됩니다. 공식 시작 단가는 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러입니다. 이 기본 단가는 모델의 공시 가격이며, SeedRouter 요청 비용을 추산할 때는 아래의 현재 SeedRouter 요금표를 사용해야 합니다.[1]

눈에 보이는 답변 길이는 계산의 일부일 뿐입니다. 짧은 답변에도 추가 추론 토큰이 포함될 수 있고, 긴 프롬프트에는 캐시된 입력이 포함될 수 있습니다. Grok 4.7 모델 페이지에서 Playground와 현재 요금을 함께 확인할 수 있습니다.

Grok 4.7 요금은 얼마인가요?

공식 발표에서는 위의 입력 및 출력 단가를 Grok 4.7의 시작 가격으로 안내합니다. 또한 가격이 다른 별도의 fast 변형도 소개합니다. 이 안내는 grok-4.7 모델을 다룹니다. 이름이 비슷한 변형의 가격을 동일한 견적으로 대신 사용할 수는 없습니다.[2]

SeedRouter를 통해 요청할 때는 다음의 현재 토큰 단가를 사용합니다.

가격을 일시적으로 불러올 수 없습니다. 잠시 후 다시 확인하세요.

요청의 입력 길이에 맞는 구간의 단가를 확인합니다. SeedRouter에서는 입력이 200,000 토큰 미만이면 표준 구간을, 200,000 토큰 이상이면 요청 전체에 긴 컨텍스트 구간을 적용합니다. 입력, 캐시된 입력과 출력 모두 해당 구간의 단가를 사용합니다. 이 기준값은 가격의 경계이며, 그만큼의 토큰을 예약한다는 뜻은 아닙니다.

service_tier: "priority" 또는 "fast"를 사용하면 선택한 입력 길이 구간의 토큰 단가가 두 배가 됩니다. 이 배수는 토큰 요금에 적용하며, 도구 요금은 별도로 계산합니다.

공식 API 개요에 명시된 컨텍스트 창은 500,000 토큰입니다. 이 기능 상한이 모든 요청에 전체 창 크기만큼의 요금이 청구된다는 의미는 아닙니다.[1]

계산에는 어떤 사용량 필드가 필요한가요?

Responses API에서는 반환된 usage의 세 값을 보관합니다.

사용량 필드사용 방법
input_tokens캐시된 부분을 포함한 전체 입력입니다
input_tokens_details.cached_tokens입력 중 캐시 입력 단가가 적용되는 부분입니다
output_tokens토큰 요금 계산에 사용하는 전체 출력입니다

일반 입력 단가를 적용하기 전에 전체 입력에서 캐시 토큰을 뺍니다. 그렇지 않으면 동일한 캐시 토큰을 일반 입력으로 한 번, 캐시된 입력으로 다시 한 번 계산하게 됩니다.

단가를 100만 토큰당 금액으로 표시하면 다음과 같습니다.

uncached input = input_tokens - cached_tokens

token cost = (
  uncached input × input rate
  + cached_tokens × cached-input rate
  + output_tokens × output rate
) / 1,000,000

각 항목에는 현재 요금표의 단가를 사용합니다. 입력 길이 구간은 캐시 토큰을 빼기 전의 전체 입력으로 선택합니다. 토큰 예상 비용에 별도 도구 요금이 자동으로 포함되지는 않습니다. 유료 검색 도구를 사용하는 요청은 해당 사용량도 계산해야 합니다.

짧은 답변이 더 많은 출력 토큰을 사용하는 이유는 무엇인가요?

최종 답변이 짧아도 추론은 출력 사용량에 포함됩니다. 예를 들어 2026년 10월 10일에 검증한, 완료된 Grok 4.7 Responses 요청 중 하나는 다음 값을 반환했습니다.

{
  "input_tokens": 3340,
  "input_tokens_details": { "cached_tokens": 1152 },
  "output_tokens": 22,
  "output_tokens_details": { "reasoning_tokens": 21 },
  "total_tokens": 3362
}

이 요청에는 캐시되지 않은 입력 2,188 토큰, 캐시된 입력 1,152 토큰, 출력 22 토큰이 포함됩니다. 추론 토큰 21개는 출력 합계의 세부 내역입니다. 이를 다시 더하면 22가 43이 되어 출력 비용을 과다 추산하게 됩니다.

이 수치는 완료된 요청 한 건을 설명하며, 다른 프롬프트의 평균이나 예측값이 아닙니다. 자신의 애플리케이션 예산을 계획하려면 대표적인 작업들의 보고된 사용량을 기록하고, 각 결과가 작업 요구 사항을 충족하는지 확인합니다.

스트리밍을 사용하면 토큰 요금이 달라지나요?

스트리밍은 답변이 전달되는 방식을 바꿉니다. 비용 추산에는 여전히 완료된 요청의 입력, 캐시된 입력과 출력 사용량을 사용합니다. 각 텍스트 조각을 별도의 청구 대상 요청으로 취급하지 말고 최종 사용량 정보를 보관합니다.

SeedRouter의 Grok 4.7 검증에서는 스트리밍 및 비스트리밍 Chat과 Responses 요청이 모두 캐시된 입력을 반영하여 완료되었습니다. 이는 사용량 계산을 확인한 것이며, 별도로 생성한 두 답변이 동일한 수의 토큰을 소비한다는 뜻은 아닙니다.

두 프롬프트의 비용은 어떻게 비교하나요?

작업과 합격 기준을 동일하게 유지합니다. 각 시도에서 전체 입력, 캐시된 입력, 출력과 답변의 사용 가능 여부를 기록합니다. 적합한 결과를 얻는 데 든 총비용을 비교하며, 생성은 성공했지만 답변이 미흡해 다시 생성해야 했던 비용도 포함합니다.

긴 대화에서는 기록을 줄여도 여전히 정확히 답변하는지 확인한 뒤 관련 없는 기록을 제거합니다. 반복되는 컨텍스트는 캐시 토큰 수를 확인해야 합니다. 텍스트를 반복했다는 사실만으로 캐시 적중을 입증할 수는 없습니다. 추론이 많은 작업에서는 답변에 표시된 단어 수만 세지 말고 실제 출력 사용량을 비교합니다.

요금에 관한 자주 묻는 질문

공식 기본 단가가 SeedRouter에서 지불하는 가격인가요?

SeedRouter에서는 위의 실시간 요금표를 사용합니다. 공식 시작 가격은 참고 정보이며, 실제 추산은 서비스의 현재 입력 길이 구간과 토큰 단가에 따라 결정됩니다.

reasoning_tokens를 output_tokens에 더해야 하나요?

아닙니다. 위의 Responses 사용량에서는 추론이 이미 전체 출력에 포함되어 있습니다. 추론 내역은 수행된 작업을 이해하는 용도로 사용하며, 출력 요금으로 한 번 더 계산하지 않습니다.

프롬프트를 반복하면 캐시 입력 할인이 보장되나요?

아닙니다. 응답이 보고한 캐시 토큰 수를 사용합니다. 해당 부분에만 캐시 입력 단가를 적용하고 나머지에는 일반 입력 단가를 적용합니다.

최종 청구 금액은 어디서 확인하나요?

사용량 기록에서 완료된 요청의 요금을 확인할 수 있습니다. 새로 추산하려면 Grok 4.7 요금 섹션을 새로고침하고 해당 요청이 보고한 사용량을 사용합니다. 오류를 반환한 요청에는 요금이 부과되지 않습니다.

출처

  1. SpaceXAI API: Grok 모델과 요금, 2026년 10월 10일 확인.
  2. Grok 4.7 소개, 2026년 9월 21일.

관련 가이드