Claude Opus 5.5 đã có trên SeedRouter
SeedRouter Docs

DeepSeek V4.1 Flash

Gọi DeepSeek V4.1 Flash qua API Chat Completions, Responses hoặc Anthropic Messages chính thức: ngữ cảnh 1 triệu token, bật hoặc tắt suy luận và hỗ trợ hình ảnh.

View Markdown

DeepSeek V4.1 Flash là mô hình nhanh, chi phí thấp của DeepSeek (API của chính DeepSeek gọi nó là deepseek-flash). Theo mặc định, mô hình suy luận trước khi trả lời, và bạn có thể tắt suy luận hoặc đặt mức độ suy luận cho từng yêu cầu. Gửi yêu cầu DeepSeek chính thức tới SeedRouter: thay đổi base URL và API key, giữ nguyên thân yêu cầu.

ID Mô hình

ID Mô hìnhCửa sổ ngữ cảnhĐầu ra tối đaMức độ suy luậnMặc định
deepseek-v4.1-flash1 triệu token384K token (393.216)none, low, high, maxBật suy luận, high

Đầu vào: văn bản và hình ảnh. Đầu ra: văn bản. Xem trang mô hình để biết giá hiện tại.

Ví dụ nhanh

curl https://api.seedrouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4.1-flash",
    "messages": [{"role": "user", "content": "Give me three names for a coffee shop."}]
  }'

Điểm cuối

Định dạngPhương thức và đường dẫnXác thực
Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completionsAuthorization: Bearer <key>
ResponsesPOST https://api.seedrouter.ai/v1/responsesAuthorization: Bearer <key>
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messagesx-api-key: <key> hoặc Authorization: Bearer <key>, cùng với anthropic-version

Cả ba đều trả về định dạng phản hồi chính thức của DeepSeek, dù có truyền phát hay không. Giữ API key trong mã phía máy chủ.

Tham số

Các trường của Chat Completions:

TênKiểuBắt buộcMặc địnhGhi chú
modelstringCó—deepseek-v4.1-flash.
messagesobject[]Có—Tin nhắn văn bản; hình ảnh dưới dạng các phần image_url (xem Đầu vào hình ảnh).
thinking.typeenumKhôngenabledenabled hoặc disabled.
reasoning_effortenumKhônghighnone (tắt suy luận), low, high hoặc max. minimal chạy như low, medium và xhigh chạy như high.
max_tokensintegerKhông8K, hoặc 64K khi bật suy luận (128K ở mức max)1–393216. Bao gồm phần suy luận.
stopstring or string[]Không—Chuỗi dừng.
response_formatobjectKhông{"type": "text"}text hoặc json_object. json_schema trả về 400.
toolsobject[]Không—Công cụ dạng hàm; chấp nhận strict.
tool_choicestring or objectKhôngnone khi không có công cụ, auto khi có công cụauto và none được áp dụng. required và một hàm được chỉ định tên được chấp nhận nhưng không buộc phải gọi.
streambooleanKhôngfalseTruyền phát server-sent events.
stream_options.include_usagebooleanKhôngfalseMỗi chunk đều mang usage, có giá trị null trừ chunk cuối.
temperaturenumberKhông10–2. Không có tác dụng ở chế độ suy luận.
top_pnumberKhông10–1. Ở chế độ suy luận, giá trị dưới 0.95 chạy như 0.95; khi tắt suy luận, giá trị giữ ở 1.
user_idstringKhông—Định danh người dùng cuối của bạn.
logprobs, top_logprobs—Không—Được chấp nhận (top_logprobs từ 0 đến 20), nhưng không trả về xác suất log.
frequency_penalty, presence_penalty—Không—DeepSeek đã ngừng dùng: được chấp nhận, không có tác dụng.

Suy luận và mức độ suy luận

Suy luận được bật theo mặc định ở mức high. Tắt bằng "thinking": {"type": "disabled"} hoặc "reasoning_effort": "none"; khi đó câu trả lời đến ngay và tốn ít token đầu ra hơn. max dành nhiều suy luận nhất cho các vấn đề khó. Phần suy luận được trả về trong reasoning_content, bên cạnh content, và được tính phí như token đầu ra.

Khi yêu cầu có tools, hãy gửi lại mọi tin nhắn assistant trước đó kèm reasoning_content của nó, như DeepSeek yêu cầu trong các hội thoại gọi công cụ.

Đầu vào hình ảnh

Hình ảnh được đặt trong content của tin nhắn người dùng dưới dạng các phần image_url, là URL http(s) công khai hoặc base64 data URI:

{"role": "user", "content": [
  {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}},
  {"type": "text", "text": "What does this chart show?"}
]}

URL dài tối đa 8192 ký tự và phải trỏ tới hình ảnh không quá 32 MiB. Thay thế URL ví dụ bằng một hình ảnh công khai của riêng bạn.

Các yếu tố chi phí

Xem giá hiện tại trên trang mô hình. Yêu cầu được tính phí theo token mà nó sử dụng:

  • token đầu vào không trúng bộ nhớ đệm (prompt_cache_miss_tokens),
  • token đầu vào trúng bộ nhớ đệm (prompt_cache_hit_tokens),
  • token đầu ra, bao gồm suy luận.

Mức giá phụ thuộc vào thời điểm yêu cầu chạy. Giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC, từ thứ Hai đến thứ Sáu; mọi giờ còn lại, kể cả cuối tuần, là giờ thấp điểm với mức giá bằng một nửa giờ cao điểm. Phí được lấy từ usage báo cáo kèm phản hồi hoàn thành. Yêu cầu thất bại không bị tính phí. Các bản ghi sử dụng của tài khoản bạn hiển thị phí chính xác cho mỗi yêu cầu.

Đầu ra

Yêu cầu Chat Completions không truyền phát trả về:

{
  "id": "bc86988e-...",
  "object": "chat.completion",
  "created": 1790585983,
  "model": "deepseek-v4.1-flash",
  "choices": [{
    "index": 0,
    "finish_reason": "stop",
    "logprobs": null,
    "message": {"role": "assistant", "reasoning_content": "...", "content": "..."}
  }],
  "usage": {
    "prompt_tokens": 36,
    "completion_tokens": 39,
    "total_tokens": 75,
    "prompt_cache_hit_tokens": 0,
    "prompt_cache_miss_tokens": 36,
    "prompt_tokens_details": {"cached_tokens": 0},
    "completion_tokens_details": {"reasoning_tokens": 0}
  }
}

Với "stream": true, mỗi chunk mang một delta chứa reasoning_content hoặc content, và chunk cuối trước data: [DONE] mang thông tin sử dụng.

Responses API và Codex

POST /v1/responses nhận thân Responses: input, instructions, max_output_tokens, reasoning.effort (giống reasoning_effort ở trên), text.format (text hoặc json_object; json_schema được chấp nhận nhưng không được áp dụng), tools (function và công cụ tùy chỉnh apply_patch), tool_choice, temperature, top_p, top_logprobs, user và stream. Phần suy luận được trả về dưới dạng mục reasoning có nội dung reasoning_text, và luồng truyền phát mang các sự kiện được đánh số từ response.created đến response.completed, với phần suy luận trong các sự kiện response.reasoning_text.delta. API này không lưu trạng thái: previous_response_id, conversation và các công cụ tích hợp sẵn như web_search bị bỏ qua, vì vậy hãy gửi toàn bộ hội thoại trong input.

Để dùng DeepSeek V4.1 Flash trong Codex, thêm một provider vào ~/.codex/config.toml và đặt SEEDROUTER_API_KEY:

model = "deepseek-v4.1-flash"
model_provider = "seedrouter"
show_raw_agent_reasoning = true

[model_providers.seedrouter]
name = "SeedRouter"
base_url = "https://api.seedrouter.ai/v1"
env_key = "SEEDROUTER_API_KEY"
wire_api = "responses"

Định dạng Anthropic Messages

Mã viết cho Anthropic Messages API cũng có thể gọi DeepSeek V4.1 Flash: gửi thân Messages tới /v1/messages với "model": "deepseek-v4.1-flash". system, max_tokens, tools, tool_choice (auto, none), thinking (enabled, disabled) và temperature (0–2) được áp dụng; output_config.effort và metadata.user_id được chấp nhận; top_k, stop_sequences và tool_choice any không có tác dụng. Phần suy luận được trả về dưới dạng các khối thinking. Hình ảnh được gửi dưới dạng nguồn base64 hoặc url.

Lỗi

Lỗi sử dụng {"error": {"code": ..., "message": "..."}} (điểm cuối Messages dùng định dạng lỗi của Anthropic). code là một mã từ danh mục lỗi chung. Các yêu cầu thất bại không bị tính phí.

Mẹo

  • Tắt suy luận cho các bước đơn giản, nhanh như phân loại hoặc trích xuất; giữ bật cho suy luận, toán học và mã.
  • Đặt ngữ cảnh dài, được tái sử dụng ở đầu prompt: đầu vào từ bộ nhớ đệm được tính phí chỉ bằng một phần nhỏ giá đầu vào.
  • Chạy các tác vụ hàng loạt lớn vào giờ thấp điểm, khi mọi mức giá đều giảm một nửa.

Liên quan