Claude Opus 5.5 đã có trên SeedRouter
SeedRouter Docs

GPT-6 Astra

Gọi GPT-6 Astra qua API OpenAI Responses hoặc Chat Completions chính thức: cửa sổ ngữ cảnh 1,05 triệu token, tối đa 128K token đầu ra và mức độ suy luận do bạn chọn.

View Markdown

GPT-6 Astra là mô hình mạnh nhất của OpenAI, được xây dựng cho những công việc đầu-cuối khó nhất: suy luận phức tạp, lập trình, nghiên cứu và tạo tài liệu. Gửi yêu cầu OpenAI Responses hoặc Chat Completions chính thức tới SeedRouter: thay đổi base URL và API key, giữ nguyên thân yêu cầu.

ID Mô hình

ID Mô hìnhCửa sổ ngữ cảnhĐầu ra tối đaMức độ suy luậnMức độ suy luận mặc định
gpt-6-astra1,05 triệu token (922K đầu vào)128K tokenlow, medium, high, xhigh, maxKhông được công bố

Đầu vào: văn bản và hình ảnh. Đầu ra: văn bản. Mốc kiến thức: ngày 30 tháng 4 năm 2026. Xem trang mô hình để biết giá hiện tại.

Ví dụ nhanh

curl https://api.seedrouter.ai/v1/responses \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "input": "Summarize the trade-offs of event sourcing in three bullet points."
  }'

Điểm cuối

Định dạngPhương thức và đường dẫnXác thực
OpenAI ResponsesPOST https://api.seedrouter.ai/v1/responsesAuthorization: Bearer <key>
OpenAI Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completionsAuthorization: Bearer <key>
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messagesx-api-key: <key> hoặc Authorization: Bearer <key>, cùng với anthropic-version

Các điểm cuối OpenAI chuyển tiếp thân yêu cầu của bạn đúng như gửi và trả về phản hồi chính thức. Giữ API key trong mã phía máy chủ.

Tham số

Các trường của Responses API:

TênKiểuBắt buộcMặc địnhGhi chú
modelstringCó—gpt-6-astra.
inputstring or object[]Có—Một prompt, hoặc các mục đầu vào: tin nhắn có content chứa các phần input_text và input_image.
instructionsstringKhông—Chỉ dẫn hệ thống (developer).
max_output_tokensintegerKhôngTối đa của mô hình16–128000. Bao gồm các token suy luận.
reasoning.effortenumKhôngKhông được công bốlow, medium, high, xhigh, max.
reasoning.summaryenumKhông—auto, concise hoặc detailed: trả về bản tóm tắt phần suy luận.
reasoning.modeenumKhôngstandardstandard hoặc pro.
reasoning.contextenumKhôngautoauto, current_turn hoặc all_turns: phần suy luận trước đó nào được hiển thị cho mô hình.
text.verbosityenumKhôngmediumlow, medium hoặc high.
text.formatobjectKhông—Đầu ra có cấu trúc, ví dụ {"type": "json_schema", "name": "...", "schema": {...}}.
temperaturenumberKhông—0–2. Không được chấp nhận: GPT-6 Astra luôn suy luận. Hãy bỏ trường này.
top_pnumberKhông—0–1. Không được chấp nhận: GPT-6 Astra luôn suy luận. Hãy bỏ trường này.
top_logprobsintegerKhông—0–20. Không được chấp nhận: GPT-6 Astra luôn suy luận. Hãy bỏ trường này.
streambooleanKhôngfalseTruyền phát phản hồi dưới dạng server-sent events.
tools, tool_choice, parallel_tool_calls, max_tool_calls, include, metadata, store, truncation, prompt_cache_key, prompt_cache_options, prompt_cache_retention, context_management, moderation, prompt, previous_response_id, conversation, user—Không—Chuyển tiếp đúng như được gửi.

Không khả dụng: background, service_tier (bao gồm Batch, Flex và chế độ nhanh) và safety_identifier.

Suy luận và mức độ suy luận

GPT-6 Astra luôn suy luận: none không được hỗ trợ và trả về lỗi 400. OpenAI không công bố mức độ suy luận mặc định cho GPT-6 Astra; hãy bỏ reasoning.effort để dùng giá trị mặc định của chính mô hình. Mức độ suy luận cao hơn thường có nghĩa là nhiều token đầu ra hơn, chờ lâu hơn và chi phí cao hơn. Token suy luận được tính phí như token đầu ra và được tính vào max_output_tokens.

Đầu vào hình ảnh

Hình ảnh được đặt trong content của tin nhắn người dùng dưới dạng các phần input_image kèm image_url:

{"role": "user", "content": [
  {"type": "input_image", "image_url": "https://example.com/chart.png"},
  {"type": "input_text", "text": "What does this chart show?"}
]}

Thay thế URL ví dụ bằng một hình ảnh công khai của riêng bạn.

Các yếu tố chi phí

Xem giá hiện tại trên trang mô hình. Yêu cầu được tính phí theo token mà nó sử dụng:

  • token đầu vào,
  • token đầu ra, bao gồm suy luận,
  • token đầu vào được lưu đệm (usage.input_tokens_details.cached_tokens), và
  • token ghi bộ nhớ đệm (usage.input_tokens_details.cache_write_tokens).

Khi prompt có hơn 272K token đầu vào, toàn bộ yêu cầu được tính phí theo mức giá ngữ cảnh dài. Phí được lấy từ usage báo cáo kèm phản hồi hoàn thành. Yêu cầu thất bại không bị tính phí. Các bản ghi sử dụng của tài khoản bạn hiển thị phí chính xác cho mỗi yêu cầu.

Đầu ra

Yêu cầu không truyền phát trả về đối tượng response chính thức:

{
  "id": "resp_...",
  "object": "response",
  "status": "completed",
  "model": "gpt-6-astra",
  "output": [{"type": "message", "role": "assistant", "content": [{"type": "output_text", "text": "..."}]}],
  "usage": {"input_tokens": 27, "input_tokens_details": {"cached_tokens": 0, "cache_write_tokens": 0}, "output_tokens": 102, "output_tokens_details": {"reasoning_tokens": 0}, "total_tokens": 129}
}

Với "stream": true, phản hồi là một luồng các sự kiện chính thức, bao gồm response.created, response.output_text.delta và response.completed; sự kiện response.completed cuối cùng chứa thông tin sử dụng.

Chat Completions

Mã Chat Completions hiện có chỉ cần base URL mới và ID mô hình:

from openai import OpenAI

client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")

chat = client.chat.completions.create(
    model="gpt-6-astra",
    messages=[{"role": "user", "content": "Hello"}],
    max_completion_tokens=1024,
)
print(chat.choices[0].message.content)

Đặt giới hạn đầu ra bằng max_completion_tokens và mức độ suy luận bằng reasoning_effort. Chat Completions không hỗ trợ gọi hàm với GPT-6 Astra; hãy dùng Responses API cho công cụ.

Định dạng Anthropic Messages

Mã viết cho Anthropic Messages API cũng có thể gọi GPT-6 Astra: gửi thân Messages tới /v1/messages với "model": "gpt-6-astra". Yêu cầu được chuyển đổi sang Chat Completions, vì vậy một trường không có đối tác trong Chat Completions sẽ không có tác dụng. Phản hồi chứa các trường Messages chính thức và có thể bao gồm một vài trường sử dụng bổ sung; hãy đọc usage.input_tokens, usage.output_tokens và các trường chính thức.

Lỗi

Lỗi sử dụng {"error": {"code": ..., "message": "..."}}. code là một mã từ danh mục lỗi chung. Các yêu cầu thất bại không bị tính phí.

Mẹo

  • Bắt đầu với medium và chỉ nâng mức độ suy luận cho các tác vụ cần suy luận sâu hơn; mức độ suy luận thay đổi cả chất lượng lẫn chi phí.
  • Đặt max_output_tokens đủ cao cho cả phần suy luận lẫn câu trả lời: đó là một ngân sách chung cho cả hai.
  • Đặt ngữ cảnh dài, được tái sử dụng ở đầu prompt để các yêu cầu sau đọc nó từ bộ nhớ đệm với mức giá thấp hơn.

Liên quan