GPT-6 Luna
Gọi GPT-6 Luna qua API OpenAI Responses hoặc Chat Completions chính thức: cửa sổ ngữ cảnh 1,05 triệu token, tối đa 128K token đầu ra và mức độ suy luận do bạn chọn.
GPT-6 Luna là mô hình GPT-6 hiệu quả nhất của OpenAI, được xây dựng cho các tác vụ tập trung, khối lượng lớn, và là mô hình có giá thấp nhất trong dòng GPT-6. Gửi yêu cầu OpenAI Responses hoặc Chat Completions chính thức tới SeedRouter: thay đổi base URL và API key, giữ nguyên thân yêu cầu.
ID Mô hình
| ID Mô hình | Cửa sổ ngữ cảnh | Đầu ra tối đa | Mức độ suy luận | Mức độ suy luận mặc định |
|---|---|---|---|---|
gpt-6-luna | 1,05 triệu token (922K đầu vào) | 128K token | none, low, medium, high, xhigh, max | medium |
Đầu vào: văn bản và hình ảnh. Đầu ra: văn bản. Mốc kiến thức: ngày 18 tháng 5 năm 2026. Xem trang mô hình để biết giá hiện tại.
Ví dụ nhanh
curl https://api.seedrouter.ai/v1/responses \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-luna",
"input": "Summarize the trade-offs of event sourcing in three bullet points."
}'Điểm cuối
| Định dạng | Phương thức và đường dẫn | Xác thực |
|---|---|---|
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses | Authorization: Bearer <key> |
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions | Authorization: Bearer <key> |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages | x-api-key: <key> hoặc Authorization: Bearer <key>, cùng với anthropic-version |
Các điểm cuối OpenAI chuyển tiếp thân yêu cầu của bạn đúng như gửi và trả về phản hồi chính thức. Giữ API key trong mã phía máy chủ.
Tham số
Các trường của Responses API:
| Tên | Kiểu | Bắt buộc | Mặc định | Ghi chú |
|---|---|---|---|---|
model | string | Có | — | gpt-6-luna. |
input | string or object[] | Có | — | Một prompt, hoặc các mục đầu vào: tin nhắn có content chứa các phần input_text và input_image. |
instructions | string | Không | — | Chỉ dẫn hệ thống (developer). |
max_output_tokens | integer | Không | Tối đa của mô hình | 16–128000. Bao gồm các token suy luận. |
reasoning.effort | enum | Không | medium | none, low, medium, high, xhigh, max. |
reasoning.summary | enum | Không | — | auto, concise hoặc detailed: trả về bản tóm tắt phần suy luận. |
reasoning.mode | enum | Không | standard | standard hoặc pro. |
reasoning.context | enum | Không | auto | auto, current_turn hoặc all_turns: phần suy luận trước đó nào được hiển thị cho mô hình. |
text.verbosity | enum | Không | medium | low, medium hoặc high. |
text.format | object | Không | — | Đầu ra có cấu trúc, ví dụ {"type": "json_schema", "name": "...", "schema": {...}}. |
temperature | number | Không | — | 0–2. Chỉ được chấp nhận khi reasoning.effort là none. |
top_p | number | Không | — | 0–1. Chỉ được chấp nhận khi reasoning.effort là none. |
top_logprobs | integer | Không | — | 0–20. Chỉ được chấp nhận khi reasoning.effort là none. |
stream | boolean | Không | false | Truyền phát phản hồi dưới dạng server-sent events. |
tools, tool_choice, parallel_tool_calls, max_tool_calls, include, metadata, store, truncation, prompt_cache_key, prompt_cache_options, prompt_cache_retention, context_management, moderation, prompt, previous_response_id, conversation, user | — | Không | — | Chuyển tiếp đúng như được gửi. |
Không khả dụng: background, service_tier (bao gồm Batch, Flex và chế độ nhanh) và safety_identifier.
Suy luận và mức độ suy luận
GPT-6 Luna mặc định là medium. Ở none, mô hình trả lời mà không suy luận, và chỉ khi đó temperature, top_p và top_logprobs mới được chấp nhận. Mức độ suy luận cao hơn thường có nghĩa là nhiều token đầu ra hơn, chờ lâu hơn và chi phí cao hơn. Token suy luận được tính phí như token đầu ra và được tính vào max_output_tokens.
Đầu vào hình ảnh
Hình ảnh được đặt trong content của tin nhắn người dùng dưới dạng các phần input_image kèm image_url:
{"role": "user", "content": [
{"type": "input_image", "image_url": "https://example.com/chart.png"},
{"type": "input_text", "text": "What does this chart show?"}
]}Thay thế URL ví dụ bằng một hình ảnh công khai của riêng bạn.
Các yếu tố chi phí
Xem giá hiện tại trên trang mô hình. Yêu cầu được tính phí theo token mà nó sử dụng:
- token đầu vào,
- token đầu ra, bao gồm suy luận,
- token đầu vào được lưu đệm (
usage.input_tokens_details.cached_tokens), và - token ghi bộ nhớ đệm (
usage.input_tokens_details.cache_write_tokens).
Khi prompt có hơn 272K token đầu vào, toàn bộ yêu cầu được tính phí theo mức giá ngữ cảnh dài. Phí được lấy từ usage báo cáo kèm phản hồi hoàn thành. Yêu cầu thất bại không bị tính phí. Các bản ghi sử dụng của tài khoản bạn hiển thị phí chính xác cho mỗi yêu cầu.
Đầu ra
Yêu cầu không truyền phát trả về đối tượng response chính thức:
{
"id": "resp_...",
"object": "response",
"status": "completed",
"model": "gpt-6-luna",
"output": [{"type": "message", "role": "assistant", "content": [{"type": "output_text", "text": "..."}]}],
"usage": {"input_tokens": 27, "input_tokens_details": {"cached_tokens": 0, "cache_write_tokens": 0}, "output_tokens": 102, "output_tokens_details": {"reasoning_tokens": 0}, "total_tokens": 129}
}Với "stream": true, phản hồi là một luồng các sự kiện chính thức, bao gồm response.created, response.output_text.delta và response.completed; sự kiện response.completed cuối cùng chứa thông tin sử dụng.
Chat Completions
Mã Chat Completions hiện có chỉ cần base URL mới và ID mô hình:
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
chat = client.chat.completions.create(
model="gpt-6-luna",
messages=[{"role": "user", "content": "Hello"}],
max_completion_tokens=1024,
)
print(chat.choices[0].message.content)Đặt giới hạn đầu ra bằng max_completion_tokens và mức độ suy luận bằng reasoning_effort. Trên Chat Completions, GPT-6 Luna chỉ hỗ trợ gọi hàm khi reasoning_effort là none; hãy dùng Responses API để suy luận kèm công cụ.
Định dạng Anthropic Messages
Mã viết cho Anthropic Messages API cũng có thể gọi GPT-6 Luna: gửi thân Messages tới /v1/messages với "model": "gpt-6-luna". Yêu cầu được chuyển đổi sang Chat Completions, vì vậy một trường không có đối tác trong Chat Completions sẽ không có tác dụng. Phản hồi chứa các trường Messages chính thức và có thể bao gồm một vài trường sử dụng bổ sung; hãy đọc usage.input_tokens, usage.output_tokens và các trường chính thức.
Lỗi
Lỗi sử dụng {"error": {"code": ..., "message": "..."}}. code là một mã từ danh mục lỗi chung. Các yêu cầu thất bại không bị tính phí.
Mẹo
- Với phân loại và trích xuất, hãy thử
nonetrước: đây là thiết lập nhanh nhất và rẻ nhất. - Đặt
max_output_tokensđủ cao cho cả phần suy luận lẫn câu trả lời: đó là một ngân sách chung cho cả hai. - Đặt ngữ cảnh dài, được tái sử dụng ở đầu prompt để các yêu cầu sau đọc nó từ bộ nhớ đệm với mức giá thấp hơn.
