Claude Opus 5.5 ist auf SeedRouter verfügbar
SeedRouter Docs

GPT-6 Luna

GPT-6 Luna über die offizielle OpenAI Responses- oder Chat-Completions-API aufrufen: Kontextfenster mit 1.05M Token, bis zu 128K Output-Token und frei wählbare Reasoning-Stufe.

View Markdown

GPT-6 Luna ist das effizienteste GPT-6-Modell von OpenAI, gebaut für fokussierte Aufgaben mit hohem Volumen, und das günstigste Modell der GPT-6-Familie. Sende die offizielle OpenAI-Responses- oder Chat-Completions-Anfrage an SeedRouter: Ändere die Basis-URL und den API-Schlüssel, behalte den Body bei.

Modell-ID

Modell-IDKontextfensterMaximale AusgabeReasoning-StufeStandard-Reasoning-Stufe
gpt-6-luna1.05M Token (922K Input)128K Tokennone, low, medium, high, xhigh, maxmedium

Eingabe: Text und Bilder. Ausgabe: Text. Wissensstand: 18. Mai 2026. Die aktuellen Preise findest du auf der Modellseite.

Kurzbeispiel

curl https://api.seedrouter.ai/v1/responses \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-luna",
    "input": "Summarize the trade-offs of event sourcing in three bullet points."
  }'

Endpunkte

FormatMethode und PfadAuthentifizierung
OpenAI ResponsesPOST https://api.seedrouter.ai/v1/responsesAuthorization: Bearer <key>
OpenAI Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completionsAuthorization: Bearer <key>
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messagesx-api-key: <key> oder Authorization: Bearer <key>, plus anthropic-version

Die OpenAI-Endpunkte leiten deinen Request-Body unverändert weiter und geben die offizielle Antwort zurück. Bewahre den API-Schlüssel in serverseitigem Code auf.

Parameter

Felder der Responses API:

NameTypErforderlichStandardHinweise
modelstringJa—gpt-6-luna.
inputstring oder object[]Ja—Ein Prompt oder Input-Items: Nachrichten, deren content input_text- und input_image-Teile enthält.
instructionsstringNein—System-Anweisungen (Developer).
max_output_tokensintegerNeinModellmaximum16–128000. Umfasst Reasoning-Token.
reasoning.effortenumNeinmediumnone, low, medium, high, xhigh, max.
reasoning.summaryenumNein—auto, concise oder detailed: gibt eine Zusammenfassung des Reasonings zurück.
reasoning.modeenumNeinstandardstandard oder pro.
reasoning.contextenumNeinautoauto, current_turn oder all_turns: welches frühere Reasoning dem Modell gezeigt wird.
text.verbosityenumNeinmediumlow, medium oder high.
text.formatobjectNein—Strukturierte Ausgabe, zum Beispiel {"type": "json_schema", "name": "...", "schema": {...}}.
temperaturenumberNein—0–2. Nur akzeptiert, wenn reasoning.effort auf none gesetzt ist.
top_pnumberNein—0–1. Nur akzeptiert, wenn reasoning.effort auf none gesetzt ist.
top_logprobsintegerNein—0–20. Nur akzeptiert, wenn reasoning.effort auf none gesetzt ist.
streambooleanNeinfalseStreame die Antwort als Server-Sent Events.
tools, tool_choice, parallel_tool_calls, max_tool_calls, include, metadata, store, truncation, prompt_cache_key, prompt_cache_options, prompt_cache_retention, context_management, moderation, prompt, previous_response_id, conversation, user—Nein—Werden unverändert durchgeleitet.

Nicht verfügbar: background, service_tier (einschließlich Batch, Flex und Fast-Modus) und safety_identifier.

Reasoning und Reasoning-Stufe

GPT-6 Luna verwendet standardmäßig medium. Bei none antwortet das Modell ohne Reasoning, und nur dann werden temperature, top_p und top_logprobs akzeptiert. Eine höhere Reasoning-Stufe bedeutet normalerweise mehr Output-Token, längere Wartezeit und höhere Kosten. Reasoning-Token werden als Output-Token berechnet und zählen zu max_output_tokens.

Bildeingabe

Bilder gehören in den content einer Benutzernachricht, als input_image-Teile mit einer image_url:

{"role": "user", "content": [
  {"type": "input_image", "image_url": "https://example.com/chart.png"},
  {"type": "input_text", "text": "What does this chart show?"}
]}

Ersetze die Beispiel-URL durch ein eigenes, öffentlich erreichbares Bild.

Abrechnungsdimensionen

Siehe die aktuellen Tarife auf der Modellseite. Eine Anfrage wird nach den Token berechnet, die sie verbraucht:

  • Input-Token,
  • Output-Token, einschließlich Reasoning,
  • gecachte Input-Token (usage.input_tokens_details.cached_tokens) und
  • Cache-Write-Token (usage.input_tokens_details.cache_write_tokens).

Hat ein Prompt mehr als 272K Input-Token, wird die gesamte Anfrage zu den Long-Context-Tarifen berechnet. Die Gebühr wird der usage entnommen, die mit der fertigen Antwort gemeldet wird. Eine fehlgeschlagene Anfrage wird nicht berechnet. Die Nutzungsdatensätze deines Kontos zeigen die genaue Gebühr für jede Anfrage.

Ausgabe

Eine Non-Streaming-Anfrage gibt das offizielle Response-Objekt zurück:

{
  "id": "resp_...",
  "object": "response",
  "status": "completed",
  "model": "gpt-6-luna",
  "output": [{"type": "message", "role": "assistant", "content": [{"type": "output_text", "text": "..."}]}],
  "usage": {"input_tokens": 27, "input_tokens_details": {"cached_tokens": 0, "cache_write_tokens": 0}, "output_tokens": 102, "output_tokens_details": {"reasoning_tokens": 0}, "total_tokens": 129}
}

Mit "stream": true ist die Antwort ein Stream der offiziellen Events, darunter response.created, response.output_text.delta und response.completed; das abschließende response.completed-Event enthält die Nutzung.

Chat Completions

Vorhandener Chat-Completions-Code braucht nur eine neue Basis-URL und Modell-ID:

from openai import OpenAI

client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")

chat = client.chat.completions.create(
    model="gpt-6-luna",
    messages=[{"role": "user", "content": "Hello"}],
    max_completion_tokens=1024,
)
print(chat.choices[0].message.content)

Setze das Output-Limit mit max_completion_tokens und die Reasoning-Stufe mit reasoning_effort. Bei Chat Completions unterstützt GPT-6 Luna Function Calling nur, wenn reasoning_effort auf none gesetzt ist; für Reasoning mit Tools nutze die Responses API.

Anthropic-Messages-Format

Auch Code, der für die Anthropic Messages API geschrieben wurde, kann GPT-6 Luna aufrufen: Sende den Messages-Body an /v1/messages mit "model": "gpt-6-luna". Die Anfrage wird in Chat Completions konvertiert, sodass ein Feld ohne Chat-Completions-Äquivalent keine Auswirkung hat. Die Antwort enthält die offiziellen Messages-Felder und kann ein paar zusätzliche Nutzungsfelder enthalten; lies usage.input_tokens, usage.output_tokens und die offiziellen Felder.

Fehler

Fehler verwenden {"error": {"code": ..., "message": "..."}}. Der code ist ein Code aus dem gemeinsamen Fehlerkatalog. Fehlgeschlagene Anfragen werden nicht berechnet.

Tipps

  • Probiere für Klassifizierung und Extraktion zuerst none: Das ist die schnellste und günstigste Einstellung.
  • Setze max_output_tokens hoch genug für Reasoning und Antwort: Es ist ein gemeinsames Budget für beide.
  • Platziere langen, wiederverwendeten Kontext am Anfang des Prompts, damit spätere Anfragen ihn zum niedrigeren Tarif aus dem Cache lesen.

Verwandt