API DeepSeek V4.1 Flash: cách lấy key và thực hiện lệnh gọi đầu tiên
Cách dùng API DeepSeek V4.1 Flash: lấy key, gọi bằng OpenAI SDK, bật hoặc tắt chế độ suy nghĩ, streaming, gửi hình ảnh và xử lý các lỗi người mới hay gặp.
Đọc dạng MarkdownĐể gọi DeepSeek V4.1 Flash, bạn cần một API key từ một nền tảng phục vụ mô hình này và một yêu cầu có ID mô hình của nó. Trên API của chính DeepSeek, mô hình có tên deepseek-flash, và các tên cũ deepseek-v4-flash và deepseek-v4-flash-vision-exp được chuyển hướng tới nó. Trên SeedRouter, ID mô hình là deepseek-v4.1-flash, và một key duy nhất gọi được nó theo kiểu trả theo mức dùng, với định dạng yêu cầu chính thức: trỏ OpenAI SDK tới https://api.seedrouter.ai/v1 và giữ nguyên code của bạn.
Hướng dẫn này dùng SeedRouter; nội dung yêu cầu giống hệt API của chính DeepSeek.
Làm sao để lấy API key DeepSeek V4.1 Flash?
- Đăng nhập SeedRouter và mở API keys.
- Tạo một key và sao chép nó; key chỉ hiển thị một lần.
- Nạp credit khi bạn cần. Tài khoản mới bắt đầu với một khoản số dư miễn phí nhỏ, và không có gói đăng ký.
Lưu key trong một biến môi trường như SEEDROUTER_API_KEY, và chỉ dùng nó từ code phía máy chủ.
Gọi DeepSeek V4.1 Flash từ Python như thế nào?
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["SEEDROUTER_API_KEY"],
base_url="https://api.seedrouter.ai/v1",
)
completion = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Give me three names for a coffee shop."}],
)
print(completion.choices[0].message.content)Chế độ suy nghĩ được bật theo mặc định, nên tin nhắn còn mang theo phần suy luận của mô hình trong reasoning_content, bên cạnh câu trả lời trong content.
Gọi từ Node.js hoặc cURL như thế nào?
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.SEEDROUTER_API_KEY,
baseURL: "https://api.seedrouter.ai/v1",
});
const completion = await client.chat.completions.create({
model: "deepseek-v4.1-flash",
messages: [{ role: "user", content: "Give me three names for a coffee shop." }],
});
console.log(completion.choices[0].message.content);curl https://api.seedrouter.ai/v1/chat/completions \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "deepseek-v4.1-flash", "messages": [{"role": "user", "content": "Give me three names for a coffee shop."}]}'Cùng một key cũng gọi được deepseek-v4.1-flash qua Responses API (/v1/responses) và định dạng Anthropic Messages (/v1/messages).
Làm sao để tắt chế độ suy nghĩ hoặc đặt mức độ suy luận?
Chế độ suy nghĩ được bật theo mặc định ở mức high. Tắt nó bằng thinking, hoặc chọn mức bằng reasoning_effort. OpenAI SDK truyền thinking qua extra_body. Yêu cầu thứ nhất tắt suy nghĩ để có câu trả lời nhanh nhất, rẻ nhất; yêu cầu thứ hai dùng mức cao nhất:
completion = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Classify: 'my card was charged twice'"}],
extra_body={"thinking": {"type": "disabled"}},
)
completion = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": "How many primes are there below 150?"}],
reasoning_effort="max",
)reasoning_effort | Tác dụng |
|---|---|
none | Tắt suy nghĩ |
low | Suy luận ngắn |
high (mặc định) | Phần lớn tác vụ |
max | Những bài toán khó nhất |
DeepSeek cũng chấp nhận minimal (chạy như low), medium và xhigh (chạy như high). Trong bài kiểm tra của chúng tôi với một câu hỏi đếm số nguyên tố, tắt suy nghĩ dùng 2 token đầu ra, low dùng 258 và max dùng 319. Phần suy luận được tính phí như đầu ra.
Làm sao để stream câu trả lời?
Thêm stream=True. Khi bật suy nghĩ, phần suy luận đến trước trong delta.reasoning_content, sau đó là câu trả lời trong delta.content, và chunk cuối cùng mang lượng token đã dùng:
stream = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Write a haiku about latency."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Tôi có thể gửi hình ảnh không?
Có. DeepSeek V4.1 Flash đọc hình ảnh một cách tự nhiên. Gửi một URL công khai hoặc một data URI base64 trong phần image_url:
completion = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}},
{"type": "text", "text": "What does this chart show?"},
],
}],
)URL hình ảnh có thể dài tối đa 8.192 ký tự và trỏ tới tệp tối đa 32 MiB.
Tôi có thể gặp những lỗi nào?
| Lỗi | Nguyên nhân | Cách khắc phục |
|---|---|---|
400 ở response_format | Không hỗ trợ json_schema | Dùng {"type": "json_object"} và mô tả cấu trúc trong prompt |
400 ở temperature hoặc top_p | Vượt quá 2 hoặc vượt quá 1 | Giữ trong phạm vi; khi bật suy nghĩ, chúng vốn ít tác dụng |
| 400 ở URL hình ảnh | Không tải được tệp dưới dạng hình ảnh | Kiểm tra URL công khai và trỏ tới một hình ảnh |
| 401 | Thiếu key hoặc key sai | Kiểm tra header Authorization |
Lỗi trả về {"error": {"code": ..., "message": "..."}}, và yêu cầu thất bại không bị tính phí.
Câu hỏi thường gặp
API DeepSeek V4.1 Flash có tương thích với OpenAI không?
Có. Nó nhận định dạng Chat Completions và Responses, nên OpenAI SDK hoạt động khi chỉ đổi base URL và mô hình. Nó cũng nhận định dạng Anthropic Messages.
Vì sao ID mô hình khác với của DeepSeek?
DeepSeek đặt tên mô hình là deepseek-flash trên API của riêng mình. SeedRouter dùng deepseek-v4.1-flash để phiên bản là một phần của tên. Ngoài ra, nội dung yêu cầu giống hệt nhau.
Một yêu cầu DeepSeek V4.1 Flash tốn bao nhiêu?
Nó được tính phí theo token, theo giá giờ cao điểm hoặc giờ thấp điểm tùy khung giờ. Hướng dẫn giá DeepSeek V4.1 Flash có giá trực tiếp và ví dụ tính toán.
Danh sách tham số đầy đủ ở đâu?
Tài liệu API DeepSeek V4.1 Flash liệt kê mọi trường, còn trang DeepSeek V4.1 Flash có playground và giá trực tiếp.



