Claude Opus 5.5을(를) SeedRouter에서 사용할 수 있습니다
SeedRouter Docs

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash API를 공식 Chat Completions, Responses 또는 Anthropic Messages 형식으로 호출하세요: 100만 토큰 컨텍스트, 켜고 끌 수 있는 사고, 이미지 입력.

View Markdown

DeepSeek V4.1 Flash는 DeepSeek의 빠르고 저렴한 모델입니다(DeepSeek 자체 API에서는 deepseek-flash라고 부릅니다). 기본적으로 답하기 전에 사고하며, 요청마다 사고를 끄거나 추론 강도를 설정할 수 있습니다. 공식 DeepSeek 요청을 SeedRouter로 보냅니다: 기본 URL과 API 키만 바꾸고 본문은 그대로 유지합니다.

모델 ID

모델 ID컨텍스트 윈도우최대 출력추론 강도기본값
deepseek-v4.1-flash100만 토큰384K 토큰(393,216)none, low, high, max사고 켜짐, high

입력: 텍스트와 이미지. 출력: 텍스트. 모델 페이지에서 현재 요금을 확인하세요.

빠른 예제

curl https://api.seedrouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4.1-flash",
    "messages": [{"role": "user", "content": "Give me three names for a coffee shop."}]
  }'

엔드포인트

형식메서드 및 경로인증
Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completionsAuthorization: Bearer <key>
ResponsesPOST https://api.seedrouter.ai/v1/responsesAuthorization: Bearer <key>
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messagesx-api-key: <key> 또는 Authorization: Bearer <key>, 그리고 anthropic-version

세 엔드포인트 모두 스트리밍 여부와 관계없이 DeepSeek의 공식 응답 형식을 반환합니다. API 키는 서버 측 코드에 보관하세요.

파라미터

Chat Completions 필드:

이름타입필수기본값설명
modelstring예—deepseek-v4.1-flash.
messagesobject[]예—텍스트 메시지. 이미지는 image_url 파트로 보냅니다(이미지 입력 참조).
thinking.typeenum아니요enabledenabled 또는 disabled.
reasoning_effortenum아니요highnone(사고 끔), low, high 또는 max. minimal은 low로, medium과 xhigh는 high로 실행됩니다.
max_tokensinteger아니요8K, 사고 사용 시 64K(max 추론 강도에서는 128K)1–393216. 추론을 포함합니다.
stopstring or string[]아니요—중지 시퀀스.
response_formatobject아니요{"type": "text"}text 또는 json_object. json_schema는 400을 반환합니다.
toolsobject[]아니요—함수 도구. strict는 허용됩니다.
tool_choicestring or object아니요도구가 없으면 none, 도구가 있으면 autoauto와 none이 적용됩니다. required와 이름을 지정한 함수는 허용되지만 호출을 강제하지는 않습니다.
streamboolean아니요false서버 전송 이벤트로 스트리밍합니다.
stream_options.include_usageboolean아니요false모든 청크가 usage를 포함하며, 마지막 청크를 제외하면 null입니다.
temperaturenumber아니요10–2. 사고 모드에서는 효과가 없습니다.
top_pnumber아니요10–1. 사고 모드에서는 0.95 미만의 값이 0.95로 실행되고, 사고를 끄면 1로 유지됩니다.
user_idstring아니요—최종 사용자 식별자.
logprobs, top_logprobs—아니요—허용되지만(top_logprobs 0–20) 로그 확률은 반환되지 않습니다.
frequency_penalty, presence_penalty—아니요—DeepSeek에서 지원 중단: 허용되지만 효과가 없습니다.

사고와 추론 강도

사고는 기본적으로 켜져 있으며 추론 강도는 high입니다. "thinking": {"type": "disabled"} 또는 "reasoning_effort": "none"으로 끄세요. 그러면 답이 바로 나오고 출력 토큰도 적게 듭니다. max는 어려운 문제에 가장 많은 추론을 씁니다. 추론은 content 옆의 reasoning_content로 반환되며 출력 토큰으로 청구됩니다.

요청에 tools가 포함되면 이전의 모든 assistant 메시지를 reasoning_content와 함께 다시 보내세요. DeepSeek가 도구 호출 대화에서 요구하는 사항입니다.

이미지 입력

이미지는 사용자 메시지의 content에 image_url 파트로 들어가며, 공개 http(s) URL 또는 base64 data URI를 사용할 수 있습니다:

{"role": "user", "content": [
  {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}},
  {"type": "text", "text": "What does this chart show?"}
]}

URL은 최대 8192자이며 최대 32 MiB 크기의 이미지를 가리켜야 합니다. 예제 URL을 본인의 공개 액세스 가능 이미지로 바꾸세요.

청구 규모

모델 페이지의 현재 요금을 참조하세요. 요청은 사용한 토큰으로 청구됩니다:

  • 캐시에 적중하지 않은 입력 토큰(prompt_cache_miss_tokens),
  • 캐시에 적중한 입력 토큰(prompt_cache_hit_tokens),
  • 추론을 포함한 출력 토큰.

요금은 요청이 실행되는 시간에 따라 달라집니다. 피크 시간대는 UTC 기준 월요일부터 금요일 01:00–04:00과 06:00–10:00입니다. 주말을 포함한 그 밖의 모든 시간은 오프피크 시간대이며 피크 요금의 절반입니다. 청구는 완성된 응답과 함께 보고된 usage에서 가져옵니다. 실패한 요청은 청구되지 않습니다. 계정의 사용 기록에 모든 요청의 정확한 청구 금액이 표시됩니다.

출력

비스트리밍 Chat Completions 요청은 다음을 반환합니다:

{
  "id": "bc86988e-...",
  "object": "chat.completion",
  "created": 1790585983,
  "model": "deepseek-v4.1-flash",
  "choices": [{
    "index": 0,
    "finish_reason": "stop",
    "logprobs": null,
    "message": {"role": "assistant", "reasoning_content": "...", "content": "..."}
  }],
  "usage": {
    "prompt_tokens": 36,
    "completion_tokens": 39,
    "total_tokens": 75,
    "prompt_cache_hit_tokens": 0,
    "prompt_cache_miss_tokens": 36,
    "prompt_tokens_details": {"cached_tokens": 0},
    "completion_tokens_details": {"reasoning_tokens": 0}
  }
}

"stream": true일 때 각 청크는 reasoning_content 또는 content가 담긴 delta를 포함하며, data: [DONE] 전의 마지막 청크가 사용량을 전달합니다.

Responses API와 Codex

POST /v1/responses는 Responses 본문을 받습니다: input, instructions, max_output_tokens, reasoning.effort(위의 reasoning_effort와 같은 값), text.format(text 또는 json_object. json_schema는 허용되지만 강제되지 않습니다), tools(function과 apply_patch 커스텀 도구), tool_choice, temperature, top_p, top_logprobs, user, stream. 추론은 reasoning_text 콘텐츠를 가진 reasoning 항목으로 반환되며, 스트림은 response.created부터 response.completed까지 번호가 매겨진 이벤트를 전달하고 추론은 response.reasoning_text.delta 이벤트에 담깁니다. 이 API는 상태를 저장하지 않습니다: previous_response_id, conversation, 그리고 web_search 같은 기본 제공 도구는 무시되므로 전체 대화를 input에 담아 보내세요.

Codex에서 DeepSeek V4.1 Flash를 사용하려면 ~/.codex/config.toml에 provider를 추가하고 SEEDROUTER_API_KEY를 설정하세요:

model = "deepseek-v4.1-flash"
model_provider = "seedrouter"
show_raw_agent_reasoning = true

[model_providers.seedrouter]
name = "SeedRouter"
base_url = "https://api.seedrouter.ai/v1"
env_key = "SEEDROUTER_API_KEY"
wire_api = "responses"

Anthropic Messages 형식

Anthropic Messages API용으로 작성한 코드도 DeepSeek V4.1 Flash를 호출할 수 있습니다: Messages 본문을 "model": "deepseek-v4.1-flash"와 함께 /v1/messages로 보내세요. system, max_tokens, tools, tool_choice(auto, none), thinking(enabled, disabled), temperature(0–2)가 적용되고, output_config.effort와 metadata.user_id는 허용되며, top_k, stop_sequences, tool_choice any는 효과가 없습니다. 추론은 thinking 블록으로 반환됩니다. 이미지는 base64 또는 url 소스로 보냅니다.

오류

오류는 {"error": {"code": ..., "message": "..."}}를 사용합니다(Messages 엔드포인트는 Anthropic의 오류 형식을 사용합니다). code는 공통 오류 카탈로그의 코드입니다. 실패한 요청은 청구되지 않습니다.

팁

  • 분류나 추출처럼 간단하고 빠른 단계에서는 사고를 끄고, 추론, 수학, 코드에서는 켜 두세요.
  • 길고 재사용되는 컨텍스트를 프롬프트 앞부분에 두세요: 캐시된 입력은 입력 요금의 일부만 청구됩니다.
  • 대규모 배치 작업은 모든 요금이 절반인 오프피크 시간대에 실행하세요.

관련