Claude Fable 5.1
Gọi Claude Fable 5.1 qua API Messages chính thức của Anthropic, hoặc định dạng OpenAI Chat Completions và Responses: suy luận thích ứng, cửa sổ ngữ cảnh 1 triệu token và tối đa 128K token đầu ra.
Claude Fable 5.1 là mô hình Fable hiện tại của Anthropic cho công việc lập trình đòi hỏi suy luận nặng và tác vụ agent chạy lâu. Gửi yêu cầu Messages chính thức của Anthropic tới SeedRouter: thay đổi base URL và API key, giữ lại thân yêu cầu. Cùng một mô hình này cũng trả lời các định dạng OpenAI Chat Completions và Responses.
ID Mô hình
| ID Mô hình | Cửa sổ ngữ cảnh | Đầu ra tối đa | Suy luận | Mức độ suy luận mặc định |
|---|---|---|---|---|
claude-fable-5-1 | 1 triệu token | 128K token | Thích ứng, luôn bật | high |
Xem trang mô hình để biết giá hiện tại.
Ví dụ nhanh
curl https://api.seedrouter.ai/v1/messages \
-H "x-api-key: $SEEDROUTER_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-fable-5-1",
"max_tokens": 1024,
"messages": [{"role": "user", "content": "Summarize the trade-offs of event sourcing in three bullet points."}]
}'Điểm cuối
| Định dạng | Phương thức và đường dẫn | Xác thực |
|---|---|---|
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages | x-api-key: <key> hoặc Authorization: Bearer <key>, cùng với anthropic-version |
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions | Authorization: Bearer <key> |
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses | Authorization: Bearer <key> |
Điểm cuối Messages chuyển tiếp thân yêu cầu của bạn đúng như gửi, bao gồm các trường tùy chọn, và trả về phản hồi chính thức. Một tiêu đề anthropic-beta cũng được chuyển tiếp. Giữ API key trong mã phía máy chủ.
Tham số
| Tên | Kiểu | Bắt buộc | Mặc định | Ghi chú |
|---|---|---|---|---|
model | string | Có | — | claude-fable-5-1. |
max_tokens | integer | Có | — | 0–128000. Bao gồm các token dùng cho suy luận. 0 chỉ làm ấm sẵn bộ nhớ đệm prompt. |
messages | object[] | Có | — | Luân phiên giữa các lượt user và assistant; content là string hoặc mảng các khối nội dung. Lượt cuối cùng phải là user. Ngoại lệ: để tiếp tục một phản hồi pause_turn, hãy gửi lại nguyên nội dung của nó làm tin nhắn assistant cuối cùng. |
system | string or object[] | Không | — | Prompt hệ thống. |
thinking | object | Không | {"type": "adaptive"} | Suy luận là thích ứng và luôn bật. display: omitted (mặc định) hoặc summarized. |
output_config.effort | enum | Không | high | low, medium, high, xhigh, max. Điều chỉnh mức độ suy luận của mô hình. |
output_config.format | object | Không | — | Một JSON schema cho đầu ra có cấu trúc. |
stop_sequences | string[] | Không | — | Dừng khi một trong các chuỗi này được tạo ra. |
stream | boolean | Không | false | Truyền phát phản hồi dưới dạng server-sent events. |
temperature | number | Không | — | Chỉ chấp nhận 1 (mặc định) để tương thích ngược; mọi giá trị khác trả về lỗi 400. Hãy bỏ nó đi. |
top_p | number | Không | — | Chỉ chấp nhận giá trị từ 0.99 đến 1 để tương thích ngược; mọi giá trị khác trả về lỗi 400. Hãy bỏ nó đi. |
top_k | integer | Không | — | Không chấp nhận: bất kỳ giá trị nào trả về lỗi 400. Hãy bỏ nó đi. |
tools | object[] | Không | — | Định nghĩa công cụ. |
tool_choice | object | Không | — | auto hoặc none; buộc một công cụ (any hoặc tool) không được mô hình này hỗ trợ. |
metadata.user_id | string | Không | — | Một id mờ cho người dùng cuối của bạn, tối đa 512 ký tự. |
cache_control | object | Không | — | Điểm ngắt bộ nhớ đệm prompt ở cấp cao nhất. |
container, context_management, mcp_servers, diagnostics, service_tier, inference_geo, speed | — | Không | — | Chuyển tiếp đúng như được gửi. |
Suy luận và mức độ suy luận
Claude Fable 5.1 luôn sử dụng suy luận thích ứng: mô hình quyết định mức độ suy luận, và output_config.effort điều chỉnh nó. Mức độ suy luận cao hơn thường có nghĩa là nhiều token đầu ra hơn, chờ đợi lâu hơn và chi phí cao hơn. Khi thinking.display được đặt thành summarized, phản hồi bao gồm các khối thinking mà bạn có thể hiển thị; khi omitted, chúng bị bỏ qua. Các token suy luận được tính là token đầu ra.
Đầu vào media
Hình ảnh và PDF đi vào content của lượt user dưới dạng các khối image và document, với nguồn url hoặc như trong API chính thức, nguồn base64:
{"role": "user", "content": [
{"type": "image", "source": {"type": "url", "url": "https://example.com/chart.png"}},
{"type": "text", "text": "What does this chart show?"}
]}Thay thế URL ví dụ bằng tệp công khai của riêng bạn.
Các yếu tố chi phí
Xem giá hiện tại trên trang mô hình. Yêu cầu được tính phí theo token mà nó sử dụng:
- token đầu vào,
- token đầu ra, bao gồm suy luận,
- đọc bộ nhớ đệm prompt, và
- ghi bộ nhớ đệm prompt, với các tỷ giá riêng biệt cho 5 phút và 1 giờ.
Phí được lấy từ usage báo cáo với phản hồi hoàn thành. Yêu cầu thất bại không bị tính phí. Các bản ghi sử dụng của tài khoản bạn hiển thị phí chính xác cho mỗi yêu cầu.
Đầu ra
Yêu cầu không truyền phát trả về đối tượng message chính thức:
{
"id": "msg_...",
"type": "message",
"role": "assistant",
"model": "claude-fable-5-1",
"content": [{"type": "text", "text": "..."}],
"stop_reason": "end_turn",
"usage": {"input_tokens": 18, "output_tokens": 4, "cache_read_input_tokens": 0, "cache_creation_input_tokens": 0}
}Với "stream": true, phản hồi là một luồng các sự kiện chính thức: message_start, content_block_start, content_block_delta, content_block_stop, message_delta và message_stop. message_delta cuối cùng chứa số lượng token đầu ra.
Định dạng tương thích OpenAI
Cùng một mô hình trả lời các định dạng OpenAI, vì vậy mã OpenAI hiện tại chỉ cần base URL mới và ID mô hình:
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
chat = client.chat.completions.create(
model="claude-fable-5-1",
messages=[{"role": "user", "content": "Hello"}],
)
response = client.responses.create(model="claude-fable-5-1", input="Hello")Những yêu cầu này được chuyển đổi sang định dạng Messages, vì vậy một trường không có đối tác Messages sẽ không có tác dụng. Phản hồi của chúng chứa các trường OpenAI chính thức và có thể bao gồm một vài trường sử dụng bổ sung; hãy đọc usage.total_tokens và các trường chính thức.
Lỗi
Lỗi trên /v1/messages sử dụng hình dạng Anthropic, {"type": "error", "error": {"type": "...", "message": "..."}}; các định dạng khác sử dụng {"error": {"code": ..., "message": "..."}}. code là một mã từ danh mục lỗi chung. Các yêu cầu thất bại không bị tính phí.
Mẹo
- Bắt đầu với mức độ suy luận mặc định và chỉ nâng nó lên cho các tác vụ cần suy luận nhiều hơn; mức độ suy luận thay đổi cả chất lượng và chi phí.
- Đặt
max_tokensđủ cao cho cả suy luận và câu trả lời: nó là một ngân sách cho cả hai. - Đặt ngữ cảnh dài, được tái sử dụng trước tiên và đánh dấu nó bằng
cache_controlđể các yêu cầu sau đó đọc nó từ bộ nhớ đệm với tỷ giá thấp hơn.
