Claude Opus 5.5 đã có trên SeedRouter

Thông số DeepSeek V4.1 Flash: cửa sổ ngữ cảnh, đầu ra tối đa, kích thước và mặc định

Thông số DeepSeek V4.1 Flash: MoE 552B tham số, ngữ cảnh 1 triệu token, đầu ra tối đa 384K, đọc hình ảnh, chế độ suy nghĩ và mặc định làm cắt ngắn câu trả lời.

Đọc dạng Markdown

DeepSeek V4.1 Flash là một mô hình mixture-of-experts (MoE) 552 tỷ tham số, với cửa sổ ngữ cảnh 1 triệu token và đầu ra tối đa 393.216 token (384K) mỗi yêu cầu. Nó đọc văn bản và hình ảnh, viết văn bản, và suy nghĩ trước khi trả lời trừ khi bạn tắt chế độ suy nghĩ. DeepSeek phát hành nó ngày 10/9/2026. Thông số khiến nhiều người vấp phải nhất là giới hạn đầu ra mặc định, thấp hơn nhiều so với mức tối đa.

Tổng quan thông số DeepSeek V4.1 Flash

Thông sốGiá trị
Nhà phát triểnDeepSeek
Phát hành10/9/2026
Kiến trúcMixture of experts, Causal Encoder–Decoder
Tổng số tham số552B
Tham số hoạt động8B cho đầu vào, 16B cho đầu ra
Cửa sổ ngữ cảnh1 triệu token
Đầu ra tối đa393.216 token (384K), đã tính cả phần suy luận
Giới hạn đầu ra mặc định8K khi tắt suy nghĩ, 64K khi bật suy nghĩ, 128K ở mức max
Đầu vàoVăn bản và hình ảnh
Đầu raVăn bản
Suy nghĩBật mặc định ở mức high; none, low, high hoặc max
ID mô hình trên SeedRouterdeepseek-v4.1-flash
ID mô hình trên API của DeepSeekdeepseek-flash

DeepSeek V4.1 Flash lớn cỡ nào?

Tổng cộng 552 tỷ tham số. Ghi chú phát hành của DeepSeek mô tả một "kiến trúc Causal Encoder–Decoder mới: chỉ 8B tham số hoạt động cho đầu vào, 16B cho đầu ra". Chỉ một phần nhỏ của mô hình chạy cho mỗi token, đó là lý do nó nhanh và rẻ khi phục vụ dù kích thước lớn.

DeepSeek cũng cho biết KV cache của nó chỉ cần "1/4 the HBM" (1/4 HBM) và "1/8 the SSD storage" (1/8 dung lượng SSD) so với thế hệ trước. Điều đó quan trọng với các phiên agent dài, nơi đầu vào từ bộ nhớ đệm chiếm phần lớn chi phí.

Cửa sổ ngữ cảnh của DeepSeek V4.1 Flash là bao nhiêu?

1 triệu token. Prompt, hình ảnh, lịch sử hội thoại và câu trả lời đều dùng chung cửa sổ này. Tài liệu tham chiếu API của DeepSeek viết: "Tổng độ dài token đầu vào và token được tạo ra bị giới hạn bởi độ dài ngữ cảnh của mô hình."

Để xem giới hạn ngữ cảnh và giới hạn đầu ra tương tác với nhau ra sao ở các mô hình, hãy đọc cửa sổ ngữ cảnh và token đầu ra tối đa.

Đầu ra tối đa của DeepSeek V4.1 Flash là bao nhiêu?

393.216 token mỗi yêu cầu, được DeepSeek ghi là "MAXIMUM: 384K". Phần suy luận được tính vào con số này.

Điểm cần lưu ý là giá trị mặc định. Nếu bạn không đặt max_tokens, tài liệu tham chiếu của DeepSeek cho biết giới hạn là "8K in non-thinking mode, 64K in thinking mode (128K with reasoning_effort set to max)" (8K ở chế độ không suy nghĩ, 64K ở chế độ suy nghĩ, 128K khi reasoning_effort đặt là max). Một câu trả lời dài hoặc một chuỗi suy luận dài sẽ chạm mức mặc định đó từ rất lâu trước trần thực sự, và câu trả lời kết thúc với finish_reason: "length".

Để có câu trả lời dài hơn, hãy tự đặt max_tokens, trong khoảng từ 1 đến 393216:

{
  "model": "deepseek-v4.1-flash",
  "max_tokens": 200000,
  "messages": [{"role": "user", "content": "Write the full migration plan."}]
}

Bạn chỉ trả tiền cho số token mô hình thực sự viết ra, nên bản thân một giới hạn cao không làm tốn thêm.

DeepSeek V4.1 Flash có đọc được hình ảnh không?

Có. DeepSeek gọi đây là mô hình "có khả năng hiểu hình ảnh nguyên bản". Trên SeedRouter, hình ảnh được đặt trong tin nhắn user dưới dạng các phần image_url, là URL công khai hoặc data URI base64. URL có thể dài tới 8.192 ký tự và trỏ tới hình ảnh tối đa 32 MiB. Đầu ra luôn là văn bản.

Các chế độ suy nghĩ hoạt động thế nào?

Chế độ suy nghĩ bật mặc định ở mức high. Bạn có thể:

  • tắt nó bằng "thinking": {"type": "disabled"} hoặc "reasoning_effort": "none", để có câu trả lời nhanh với ít token đầu ra hơn;
  • đặt reasoning_effort là low, high hoặc max.

Phần suy luận được trả về trong reasoning_content, bên cạnh câu trả lời, và được tính phí như token đầu ra. Khi bật suy nghĩ, temperature không có tác dụng và các giá trị top_p dưới 0.95 được chạy như 0.95.

Những API nào gọi được mô hình này?

Trên SeedRouter, DeepSeek V4.1 Flash nhận ba định dạng yêu cầu với cùng một khóa API:

Định dạngEndpoint
OpenAI Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completions
OpenAI ResponsesPOST https://api.seedrouter.ai/v1/responses
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messages

Gọi công cụ hoạt động ở cả ba định dạng. Định dạng Anthropic là định dạng Claude Code dùng, còn định dạng Responses là định dạng Codex dùng; hướng dẫn thiết lập Claude Code và Codex có các cấu hình đã được kiểm thử. Mọi tham số được liệt kê trong tài liệu tham chiếu API DeepSeek V4.1 Flash.

Giá được tính thế nào?

Theo token, với mức giá riêng cho đầu vào trúng bộ nhớ đệm, đầu vào không trúng bộ nhớ đệm, và đầu ra. Giá giảm một nửa vào giờ thấp điểm: giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC, từ thứ Hai đến thứ Sáu, mọi giờ còn lại là giờ thấp điểm. Trang DeepSeek V4.1 Flash hiển thị giá trực tiếp, và hướng dẫn giá có các ví dụ tính toán.

Câu hỏi thường gặp

DeepSeek V4.1 Flash có phải mã nguồn mở không?

DeepSeek công bố trọng số trên Hugging Face; DeepSeek V4.1 Flash có miễn phí không? giải thích điều đó có ý nghĩa gì với chi phí.

deepseek-v4-flash có phải cùng một mô hình không?

Trên API của chính DeepSeek, tên cũ này giờ được chuyển tới V4.1 Flash. Trang giá của DeepSeek ghi "các mô hình tương ứng đã ngừng hoạt động, yêu cầu tới chúng được phục vụ bởi mô hình DeepSeek-V4.1-Flash". V4.1 Flash so với V4 Flash liệt kê những gì đã thay đổi.

Vì sao DeepSeek V4.1 Flash dừng ở 8K token?

Đó là giới hạn đầu ra mặc định khi tắt suy nghĩ. Đặt max_tokens tới 393216 để cho phép câu trả lời dài hơn.

Cửa sổ ngữ cảnh có bao gồm đầu ra không?

Có. Đầu vào và đầu ra dùng chung cửa sổ 1 triệu token.

DeepSeek V4.1 Flash so với DeepSeek V4 Pro thế nào?

DeepSeek báo cáo V4.1 Flash vượt V4 Pro trên các benchmark của họ, và nó rẻ hơn. Xem DeepSeek V4.1 Flash vs V4 Pro.

Hướng dẫn liên quan