DeepSeek V4.1 Flash
Gọi DeepSeek V4.1 Flash qua API Chat Completions, Responses hoặc Anthropic Messages chính thức: ngữ cảnh 1 triệu token, bật hoặc tắt suy luận và hỗ trợ hình ảnh.
DeepSeek V4.1 Flash là mô hình nhanh, chi phí thấp của DeepSeek (API của chính DeepSeek gọi nó là deepseek-flash). Theo mặc định, mô hình suy luận trước khi trả lời, và bạn có thể tắt suy luận hoặc đặt mức độ suy luận cho từng yêu cầu. Gửi yêu cầu DeepSeek chính thức tới SeedRouter: thay đổi base URL và API key, giữ nguyên thân yêu cầu.
ID Mô hình
| ID Mô hình | Cửa sổ ngữ cảnh | Đầu ra tối đa | Mức độ suy luận | Mặc định |
|---|---|---|---|---|
deepseek-v4.1-flash | 1 triệu token | 384K token (393.216) | none, low, high, max | Bật suy luận, high |
Đầu vào: văn bản và hình ảnh. Đầu ra: văn bản. Xem trang mô hình để biết giá hiện tại.
Ví dụ nhanh
curl https://api.seedrouter.ai/v1/chat/completions \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4.1-flash",
"messages": [{"role": "user", "content": "Give me three names for a coffee shop."}]
}'Điểm cuối
| Định dạng | Phương thức và đường dẫn | Xác thực |
|---|---|---|
| Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions | Authorization: Bearer <key> |
| Responses | POST https://api.seedrouter.ai/v1/responses | Authorization: Bearer <key> |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages | x-api-key: <key> hoặc Authorization: Bearer <key>, cùng với anthropic-version |
Cả ba đều trả về định dạng phản hồi chính thức của DeepSeek, dù có truyền phát hay không. Giữ API key trong mã phía máy chủ.
Tham số
Các trường của Chat Completions:
| Tên | Kiểu | Bắt buộc | Mặc định | Ghi chú |
|---|---|---|---|---|
model | string | Có | — | deepseek-v4.1-flash. |
messages | object[] | Có | — | Tin nhắn văn bản; hình ảnh dưới dạng các phần image_url (xem Đầu vào hình ảnh). |
thinking.type | enum | Không | enabled | enabled hoặc disabled. |
reasoning_effort | enum | Không | high | none (tắt suy luận), low, high hoặc max. minimal chạy như low, medium và xhigh chạy như high. |
max_tokens | integer | Không | 8K, hoặc 64K khi bật suy luận (128K ở mức max) | 1–393216. Bao gồm phần suy luận. |
stop | string or string[] | Không | — | Chuỗi dừng. |
response_format | object | Không | {"type": "text"} | text hoặc json_object. json_schema trả về 400. |
tools | object[] | Không | — | Công cụ dạng hàm; chấp nhận strict. |
tool_choice | string or object | Không | none khi không có công cụ, auto khi có công cụ | auto và none được áp dụng. required và một hàm được chỉ định tên được chấp nhận nhưng không buộc phải gọi. |
stream | boolean | Không | false | Truyền phát server-sent events. |
stream_options.include_usage | boolean | Không | false | Mỗi chunk đều mang usage, có giá trị null trừ chunk cuối. |
temperature | number | Không | 1 | 0–2. Không có tác dụng ở chế độ suy luận. |
top_p | number | Không | 1 | 0–1. Ở chế độ suy luận, giá trị dưới 0.95 chạy như 0.95; khi tắt suy luận, giá trị giữ ở 1. |
user_id | string | Không | — | Định danh người dùng cuối của bạn. |
logprobs, top_logprobs | — | Không | — | Được chấp nhận (top_logprobs từ 0 đến 20), nhưng không trả về xác suất log. |
frequency_penalty, presence_penalty | — | Không | — | DeepSeek đã ngừng dùng: được chấp nhận, không có tác dụng. |
Suy luận và mức độ suy luận
Suy luận được bật theo mặc định ở mức high. Tắt bằng "thinking": {"type": "disabled"} hoặc "reasoning_effort": "none"; khi đó câu trả lời đến ngay và tốn ít token đầu ra hơn. max dành nhiều suy luận nhất cho các vấn đề khó. Phần suy luận được trả về trong reasoning_content, bên cạnh content, và được tính phí như token đầu ra.
Khi yêu cầu có tools, hãy gửi lại mọi tin nhắn assistant trước đó kèm reasoning_content của nó, như DeepSeek yêu cầu trong các hội thoại gọi công cụ.
Đầu vào hình ảnh
Hình ảnh được đặt trong content của tin nhắn người dùng dưới dạng các phần image_url, là URL http(s) công khai hoặc base64 data URI:
{"role": "user", "content": [
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}},
{"type": "text", "text": "What does this chart show?"}
]}URL dài tối đa 8192 ký tự và phải trỏ tới hình ảnh không quá 32 MiB. Thay thế URL ví dụ bằng một hình ảnh công khai của riêng bạn.
Các yếu tố chi phí
Xem giá hiện tại trên trang mô hình. Yêu cầu được tính phí theo token mà nó sử dụng:
- token đầu vào không trúng bộ nhớ đệm (
prompt_cache_miss_tokens), - token đầu vào trúng bộ nhớ đệm (
prompt_cache_hit_tokens), - token đầu ra, bao gồm suy luận.
Mức giá phụ thuộc vào thời điểm yêu cầu chạy. Giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC, từ thứ Hai đến thứ Sáu; mọi giờ còn lại, kể cả cuối tuần, là giờ thấp điểm với mức giá bằng một nửa giờ cao điểm. Phí được lấy từ usage báo cáo kèm phản hồi hoàn thành. Yêu cầu thất bại không bị tính phí. Các bản ghi sử dụng của tài khoản bạn hiển thị phí chính xác cho mỗi yêu cầu.
Đầu ra
Yêu cầu Chat Completions không truyền phát trả về:
{
"id": "bc86988e-...",
"object": "chat.completion",
"created": 1790585983,
"model": "deepseek-v4.1-flash",
"choices": [{
"index": 0,
"finish_reason": "stop",
"logprobs": null,
"message": {"role": "assistant", "reasoning_content": "...", "content": "..."}
}],
"usage": {
"prompt_tokens": 36,
"completion_tokens": 39,
"total_tokens": 75,
"prompt_cache_hit_tokens": 0,
"prompt_cache_miss_tokens": 36,
"prompt_tokens_details": {"cached_tokens": 0},
"completion_tokens_details": {"reasoning_tokens": 0}
}
}Với "stream": true, mỗi chunk mang một delta chứa reasoning_content hoặc content, và chunk cuối trước data: [DONE] mang thông tin sử dụng.
Responses API và Codex
POST /v1/responses nhận thân Responses: input, instructions, max_output_tokens, reasoning.effort (giống reasoning_effort ở trên), text.format (text hoặc json_object; json_schema được chấp nhận nhưng không được áp dụng), tools (function và công cụ tùy chỉnh apply_patch), tool_choice, temperature, top_p, top_logprobs, user và stream. Phần suy luận được trả về dưới dạng mục reasoning có nội dung reasoning_text, và luồng truyền phát mang các sự kiện được đánh số từ response.created đến response.completed, với phần suy luận trong các sự kiện response.reasoning_text.delta. API này không lưu trạng thái: previous_response_id, conversation và các công cụ tích hợp sẵn như web_search bị bỏ qua, vì vậy hãy gửi toàn bộ hội thoại trong input.
Để dùng DeepSeek V4.1 Flash trong Codex, thêm một provider vào ~/.codex/config.toml và đặt SEEDROUTER_API_KEY:
model = "deepseek-v4.1-flash"
model_provider = "seedrouter"
show_raw_agent_reasoning = true
[model_providers.seedrouter]
name = "SeedRouter"
base_url = "https://api.seedrouter.ai/v1"
env_key = "SEEDROUTER_API_KEY"
wire_api = "responses"Định dạng Anthropic Messages
Mã viết cho Anthropic Messages API cũng có thể gọi DeepSeek V4.1 Flash: gửi thân Messages tới /v1/messages với "model": "deepseek-v4.1-flash". system, max_tokens, tools, tool_choice (auto, none), thinking (enabled, disabled) và temperature (0–2) được áp dụng; output_config.effort và metadata.user_id được chấp nhận; top_k, stop_sequences và tool_choice any không có tác dụng. Phần suy luận được trả về dưới dạng các khối thinking. Hình ảnh được gửi dưới dạng nguồn base64 hoặc url.
Lỗi
Lỗi sử dụng {"error": {"code": ..., "message": "..."}} (điểm cuối Messages dùng định dạng lỗi của Anthropic). code là một mã từ danh mục lỗi chung. Các yêu cầu thất bại không bị tính phí.
Mẹo
- Tắt suy luận cho các bước đơn giản, nhanh như phân loại hoặc trích xuất; giữ bật cho suy luận, toán học và mã.
- Đặt ngữ cảnh dài, được tái sử dụng ở đầu prompt: đầu vào từ bộ nhớ đệm được tính phí chỉ bằng một phần nhỏ giá đầu vào.
- Chạy các tác vụ hàng loạt lớn vào giờ thấp điểm, khi mọi mức giá đều giảm một nửa.
