GPT-6 Luna
GPT-6 Luna über die offizielle OpenAI Responses- oder Chat-Completions-API aufrufen: Kontextfenster mit 1.05M Token, bis zu 128K Output-Token und frei wählbare Reasoning-Stufe.
GPT-6 Luna ist das effizienteste GPT-6-Modell von OpenAI, gebaut für fokussierte Aufgaben mit hohem Volumen, und das günstigste Modell der GPT-6-Familie. Sende die offizielle OpenAI-Responses- oder Chat-Completions-Anfrage an SeedRouter: Ändere die Basis-URL und den API-Schlüssel, behalte den Body bei.
Modell-ID
| Modell-ID | Kontextfenster | Maximale Ausgabe | Reasoning-Stufe | Standard-Reasoning-Stufe |
|---|---|---|---|---|
gpt-6-luna | 1.05M Token (922K Input) | 128K Token | none, low, medium, high, xhigh, max | medium |
Eingabe: Text und Bilder. Ausgabe: Text. Wissensstand: 18. Mai 2026. Die aktuellen Preise findest du auf der Modellseite.
Kurzbeispiel
curl https://api.seedrouter.ai/v1/responses \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-luna",
"input": "Summarize the trade-offs of event sourcing in three bullet points."
}'Endpunkte
| Format | Methode und Pfad | Authentifizierung |
|---|---|---|
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses | Authorization: Bearer <key> |
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions | Authorization: Bearer <key> |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages | x-api-key: <key> oder Authorization: Bearer <key>, plus anthropic-version |
Die OpenAI-Endpunkte leiten deinen Request-Body unverändert weiter und geben die offizielle Antwort zurück. Bewahre den API-Schlüssel in serverseitigem Code auf.
Parameter
Felder der Responses API:
| Name | Typ | Erforderlich | Standard | Hinweise |
|---|---|---|---|---|
model | string | Ja | — | gpt-6-luna. |
input | string oder object[] | Ja | — | Ein Prompt oder Input-Items: Nachrichten, deren content input_text- und input_image-Teile enthält. |
instructions | string | Nein | — | System-Anweisungen (Developer). |
max_output_tokens | integer | Nein | Modellmaximum | 16–128000. Umfasst Reasoning-Token. |
reasoning.effort | enum | Nein | medium | none, low, medium, high, xhigh, max. |
reasoning.summary | enum | Nein | — | auto, concise oder detailed: gibt eine Zusammenfassung des Reasonings zurück. |
reasoning.mode | enum | Nein | standard | standard oder pro. |
reasoning.context | enum | Nein | auto | auto, current_turn oder all_turns: welches frühere Reasoning dem Modell gezeigt wird. |
text.verbosity | enum | Nein | medium | low, medium oder high. |
text.format | object | Nein | — | Strukturierte Ausgabe, zum Beispiel {"type": "json_schema", "name": "...", "schema": {...}}. |
temperature | number | Nein | — | 0–2. Nur akzeptiert, wenn reasoning.effort auf none gesetzt ist. |
top_p | number | Nein | — | 0–1. Nur akzeptiert, wenn reasoning.effort auf none gesetzt ist. |
top_logprobs | integer | Nein | — | 0–20. Nur akzeptiert, wenn reasoning.effort auf none gesetzt ist. |
stream | boolean | Nein | false | Streame die Antwort als Server-Sent Events. |
tools, tool_choice, parallel_tool_calls, max_tool_calls, include, metadata, store, truncation, prompt_cache_key, prompt_cache_options, prompt_cache_retention, context_management, moderation, prompt, previous_response_id, conversation, user | — | Nein | — | Werden unverändert durchgeleitet. |
Nicht verfügbar: background, service_tier (einschließlich Batch, Flex und Fast-Modus) und safety_identifier.
Reasoning und Reasoning-Stufe
GPT-6 Luna verwendet standardmäßig medium. Bei none antwortet das Modell ohne Reasoning, und nur dann werden temperature, top_p und top_logprobs akzeptiert. Eine höhere Reasoning-Stufe bedeutet normalerweise mehr Output-Token, längere Wartezeit und höhere Kosten. Reasoning-Token werden als Output-Token berechnet und zählen zu max_output_tokens.
Bildeingabe
Bilder gehören in den content einer Benutzernachricht, als input_image-Teile mit einer image_url:
{"role": "user", "content": [
{"type": "input_image", "image_url": "https://example.com/chart.png"},
{"type": "input_text", "text": "What does this chart show?"}
]}Ersetze die Beispiel-URL durch ein eigenes, öffentlich erreichbares Bild.
Abrechnungsdimensionen
Siehe die aktuellen Tarife auf der Modellseite. Eine Anfrage wird nach den Token berechnet, die sie verbraucht:
- Input-Token,
- Output-Token, einschließlich Reasoning,
- gecachte Input-Token (
usage.input_tokens_details.cached_tokens) und - Cache-Write-Token (
usage.input_tokens_details.cache_write_tokens).
Hat ein Prompt mehr als 272K Input-Token, wird die gesamte Anfrage zu den Long-Context-Tarifen berechnet. Die Gebühr wird der usage entnommen, die mit der fertigen Antwort gemeldet wird. Eine fehlgeschlagene Anfrage wird nicht berechnet. Die Nutzungsdatensätze deines Kontos zeigen die genaue Gebühr für jede Anfrage.
Ausgabe
Eine Non-Streaming-Anfrage gibt das offizielle Response-Objekt zurück:
{
"id": "resp_...",
"object": "response",
"status": "completed",
"model": "gpt-6-luna",
"output": [{"type": "message", "role": "assistant", "content": [{"type": "output_text", "text": "..."}]}],
"usage": {"input_tokens": 27, "input_tokens_details": {"cached_tokens": 0, "cache_write_tokens": 0}, "output_tokens": 102, "output_tokens_details": {"reasoning_tokens": 0}, "total_tokens": 129}
}Mit "stream": true ist die Antwort ein Stream der offiziellen Events, darunter response.created, response.output_text.delta und response.completed; das abschließende response.completed-Event enthält die Nutzung.
Chat Completions
Vorhandener Chat-Completions-Code braucht nur eine neue Basis-URL und Modell-ID:
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
chat = client.chat.completions.create(
model="gpt-6-luna",
messages=[{"role": "user", "content": "Hello"}],
max_completion_tokens=1024,
)
print(chat.choices[0].message.content)Setze das Output-Limit mit max_completion_tokens und die Reasoning-Stufe mit reasoning_effort. Bei Chat Completions unterstützt GPT-6 Luna Function Calling nur, wenn reasoning_effort auf none gesetzt ist; für Reasoning mit Tools nutze die Responses API.
Anthropic-Messages-Format
Auch Code, der für die Anthropic Messages API geschrieben wurde, kann GPT-6 Luna aufrufen: Sende den Messages-Body an /v1/messages mit "model": "gpt-6-luna". Die Anfrage wird in Chat Completions konvertiert, sodass ein Feld ohne Chat-Completions-Äquivalent keine Auswirkung hat. Die Antwort enthält die offiziellen Messages-Felder und kann ein paar zusätzliche Nutzungsfelder enthalten; lies usage.input_tokens, usage.output_tokens und die offiziellen Felder.
Fehler
Fehler verwenden {"error": {"code": ..., "message": "..."}}. Der code ist ein Code aus dem gemeinsamen Fehlerkatalog. Fehlgeschlagene Anfragen werden nicht berechnet.
Tipps
- Probiere für Klassifizierung und Extraktion zuerst
none: Das ist die schnellste und günstigste Einstellung. - Setze
max_output_tokenshoch genug für Reasoning und Antwort: Es ist ein gemeinsames Budget für beide. - Platziere langen, wiederverwendeten Kontext am Anfang des Prompts, damit spätere Anfragen ihn zum niedrigeren Tarif aus dem Cache lesen.
