GPT-6 Luna
Wywołaj GPT-6 Luna przez oficjalne API OpenAI Responses lub Chat Completions: okno kontekstu 1.05M tokenów, do 128K tokenów na wyjściu i poziom rozumowania, który wybierasz sam.
GPT-6 Luna to najbardziej wydajny model GPT-6 od OpenAI, stworzony do konkretnych zadań w dużej skali, i najtańszy model w rodzinie GPT-6. Wyślij oficjalne żądanie OpenAI Responses lub Chat Completions do SeedRouter: zmień bazowy adres URL i klucz API, zachowaj treść żądania.
ID modelu
| ID modelu | Okno kontekstu | Maks. wyjście | Poziom rozumowania | Domyślny poziom rozumowania |
|---|---|---|---|---|
gpt-6-luna | 1.05M tokenów (922K na wejściu) | 128K tokenów | none, low, medium, high, xhigh, max | medium |
Wejście: tekst i obrazy. Wyjście: tekst. Granica wiedzy: 18 maja 2026. Aktualne ceny znajdziesz na stronie modelu.
Krótki przykład
curl https://api.seedrouter.ai/v1/responses \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-luna",
"input": "Summarize the trade-offs of event sourcing in three bullet points."
}'Punkty końcowe
| Format | Metoda i ścieżka | Uwierzytelnianie |
|---|---|---|
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses | Authorization: Bearer <key> |
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions | Authorization: Bearer <key> |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages | x-api-key: <key> lub Authorization: Bearer <key>, plus anthropic-version |
Punkty końcowe OpenAI przekazują treść żądania bez zmian i zwracają oficjalną odpowiedź. Przechowuj klucz API po stronie serwera.
Parametry
Pola Responses API:
| Nazwa | Typ | Wymagany | Domyślnie | Uwagi |
|---|---|---|---|---|
model | string | Tak | — | gpt-6-luna. |
input | string or object[] | Tak | — | Prompt albo elementy wejściowe: wiadomości, których content zawiera części input_text i input_image. |
instructions | string | Nie | — | Instrukcje systemowe (developer). |
max_output_tokens | integer | Nie | Maksimum modelu | 16–128000. Obejmuje tokeny rozumowania. |
reasoning.effort | enum | Nie | medium | none, low, medium, high, xhigh, max. |
reasoning.summary | enum | Nie | — | auto, concise lub detailed: zwraca podsumowanie rozumowania. |
reasoning.mode | enum | Nie | standard | standard lub pro. |
reasoning.context | enum | Nie | auto | auto, current_turn lub all_turns: które wcześniejsze rozumowanie jest widoczne dla modelu. |
text.verbosity | enum | Nie | medium | low, medium lub high. |
text.format | object | Nie | — | Ustrukturyzowane wyjście, na przykład {"type": "json_schema", "name": "...", "schema": {...}}. |
temperature | number | Nie | — | 0–2. Akceptowane tylko, gdy reasoning.effort ma wartość none. |
top_p | number | Nie | — | 0–1. Akceptowane tylko, gdy reasoning.effort ma wartość none. |
top_logprobs | integer | Nie | — | 0–20. Akceptowane tylko, gdy reasoning.effort ma wartość none. |
stream | boolean | Nie | false | Strumieniuje odpowiedź jako server-sent events. |
tools, tool_choice, parallel_tool_calls, max_tool_calls, include, metadata, store, truncation, prompt_cache_key, prompt_cache_options, prompt_cache_retention, context_management, moderation, prompt, previous_response_id, conversation, user | — | Nie | — | Przekazywane bez zmian. |
Niedostępne: background, service_tier (w tym Batch, Flex i tryb szybki) oraz safety_identifier.
Rozumowanie i poziom rozumowania
Domyślnie GPT-6 Luna używa medium. Przy none model odpowiada bez rozumowania i tylko wtedy akceptuje temperature, top_p i top_logprobs. Wyższy poziom rozumowania zwykle oznacza więcej tokenów wyjściowych, dłuższe oczekiwanie i wyższy koszt. Tokeny rozumowania są naliczane jako tokeny wyjściowe i wliczają się do max_output_tokens.
Obrazy na wejściu
Obrazy umieszczasz w content wiadomości użytkownika jako części input_image z image_url:
{"role": "user", "content": [
{"type": "input_image", "image_url": "https://example.com/chart.png"},
{"type": "input_text", "text": "What does this chart show?"}
]}Zastąp przykładowy adres URL publicznie dostępnym własnym obrazem.
Wymiary rozliczeniowe
Aktualne stawki znajdziesz na stronie modelu. Żądanie jest rozliczane na podstawie użytych tokenów:
- tokeny wejściowe,
- tokeny wyjściowe, w tym rozumowanie,
- tokeny wejściowe z cache (
usage.input_tokens_details.cached_tokens) oraz - tokeny zapisu do cache (
usage.input_tokens_details.cache_write_tokens).
Gdy prompt ma więcej niż 272K tokenów wejściowych, całe żądanie jest rozliczane według stawek za długi kontekst. Opłata jest pobierana na podstawie usage raportowanego z ukończoną odpowiedzią. Żądanie, które się nie powiedzie, nie jest naliczane. Rekordy użycia konta pokazują dokładną opłatę za każde żądanie.
Wyjście
Żądanie bez strumieniowania zwraca oficjalny obiekt odpowiedzi:
{
"id": "resp_...",
"object": "response",
"status": "completed",
"model": "gpt-6-luna",
"output": [{"type": "message", "role": "assistant", "content": [{"type": "output_text", "text": "..."}]}],
"usage": {"input_tokens": 27, "input_tokens_details": {"cached_tokens": 0, "cache_write_tokens": 0}, "output_tokens": 102, "output_tokens_details": {"reasoning_tokens": 0}, "total_tokens": 129}
}Z "stream": true odpowiedź to strumień oficjalnych zdarzeń, w tym response.created, response.output_text.delta i response.completed; końcowe zdarzenie response.completed zawiera dane o użyciu.
Chat Completions
Istniejący kod Chat Completions potrzebuje tylko nowego bazowego adresu URL i ID modelu:
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
chat = client.chat.completions.create(
model="gpt-6-luna",
messages=[{"role": "user", "content": "Hello"}],
max_completion_tokens=1024,
)
print(chat.choices[0].message.content)Limit wyjścia ustawiasz przez max_completion_tokens, a poziom rozumowania przez reasoning_effort. W Chat Completions GPT-6 Luna obsługuje wywoływanie funkcji tylko przy reasoning_effort ustawionym na none; do rozumowania z narzędziami użyj Responses API.
Format Anthropic Messages
Kod napisany dla Anthropic Messages API też może wywoływać GPT-6 Luna: wyślij treść Messages na /v1/messages z "model": "gpt-6-luna". Żądanie jest konwertowane na Chat Completions, więc pole bez odpowiednika w Chat Completions nie ma efektu. Odpowiedź zawiera oficjalne pola Messages i może zawierać kilka dodatkowych pól użycia; odczytuj usage.input_tokens, usage.output_tokens i pola oficjalne.
Błędy
Błędy używają {"error": {"code": ..., "message": "..."}}. code to kod z wspólnego katalogu błędów. Żądania, które się nie powiodą, nie są naliczane.
Wskazówki
- Przy klasyfikacji i ekstrakcji najpierw wypróbuj
none: to najszybsze i najtańsze ustawienie. - Ustaw
max_output_tokensna tyle wysoko, aby zmieścić zarówno rozumowanie, jak i odpowiedź: to jeden budżet na oba. - Umieść długi, ponownie używany kontekst na początku promptu, aby późniejsze żądania odczytywały go z cache po niższej stawce.
