GPT-6 Luna
GPT-6 Luna を公式の OpenAI Responses API または Chat Completions API で呼び出せます。105万トークンのコンテキストウィンドウ、最大128Kの出力トークン、推論強度は自由に選択できます。
GPT-6 Luna は OpenAI で最も効率的な GPT-6 モデルで、範囲の絞られた大量処理のタスク向けに作られており、GPT-6 ファミリーで最も低コストなモデルです。公式の OpenAI Responses または Chat Completions リクエストを SeedRouter に送信します: ベース URL と API キーを変更し、ボディはそのままにします。
モデル ID
| モデル ID | コンテキストウィンドウ | 最大出力 | 推論強度 | デフォルトの推論強度 |
|---|---|---|---|---|
gpt-6-luna | 105万トークン(うち入力は922K) | 128Kトークン | none、low、medium、high、xhigh、max | medium |
入力: テキストと画像。出力: テキスト。ナレッジカットオフ: 2026年5月18日。現在の料金はモデルページをご確認ください。
クイックサンプル
curl https://api.seedrouter.ai/v1/responses \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-luna",
"input": "Summarize the trade-offs of event sourcing in three bullet points."
}'エンドポイント
| フォーマット | メソッドとパス | 認証 |
|---|---|---|
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses | Authorization: Bearer <key> |
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions | Authorization: Bearer <key> |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages | x-api-key: <key> または Authorization: Bearer <key>、加えて anthropic-version |
OpenAI エンドポイントはリクエストボディをそのまま転送し、公式レスポンスを返します。API キーはサーバー側のコードに保管してください。
パラメータ
Responses API のフィールド:
| 名前 | 型 | 必須 | デフォルト | 説明 |
|---|---|---|---|---|
model | string | はい | — | gpt-6-luna。 |
input | string or object[] | はい | — | プロンプト、または入力アイテム: content に input_text と input_image のパートを含むメッセージです。 |
instructions | string | いいえ | — | システム(デベロッパー)指示。 |
max_output_tokens | integer | いいえ | モデルの上限 | 16~128000。推論トークンを含みます。 |
reasoning.effort | enum | いいえ | medium | none、low、medium、high、xhigh、max。 |
reasoning.summary | enum | いいえ | — | auto、concise または detailed: 推論のサマリーを返します。 |
reasoning.mode | enum | いいえ | standard | standard または pro。 |
reasoning.context | enum | いいえ | auto | auto、current_turn または all_turns: 以前のどの推論をモデルに見せるかを指定します。 |
text.verbosity | enum | いいえ | medium | low、medium または high。 |
text.format | object | いいえ | — | 構造化出力。例: {"type": "json_schema", "name": "...", "schema": {...}}。 |
temperature | number | いいえ | — | 0~2。reasoning.effort が none のときのみ受け付けられます。 |
top_p | number | いいえ | — | 0~1。reasoning.effort が none のときのみ受け付けられます。 |
top_logprobs | integer | いいえ | — | 0~20。reasoning.effort が none のときのみ受け付けられます。 |
stream | boolean | いいえ | false | レスポンスをサーバー送信イベントとしてストリーミングします。 |
tools, tool_choice, parallel_tool_calls, max_tool_calls, include, metadata, store, truncation, prompt_cache_key, prompt_cache_options, prompt_cache_retention, context_management, moderation, prompt, previous_response_id, conversation, user | — | いいえ | — | そのまま転送されます。 |
利用できないもの: background、service_tier(Batch、Flex、fast モードを含む)、safety_identifier。
推論と推論強度
GPT-6 Luna のデフォルトは medium です。none ではモデルは推論せずに回答し、そのときに限り temperature、top_p、top_logprobs が受け付けられます。推論強度を上げると、通常は出力トークンが増え、待ち時間が長くなり、コストも高くなります。推論トークンは出力トークンとして請求され、max_output_tokens にカウントされます。
画像入力
画像は、ユーザーメッセージの content に image_url を持つ input_image パートとして入れます:
{"role": "user", "content": [
{"type": "input_image", "image_url": "https://example.com/chart.png"},
{"type": "input_text", "text": "What does this chart show?"}
]}例の URL を、公開アクセス可能な独自の画像に置き換えてください。
請求ディメンション
モデルページの現在のレートをご覧ください。リクエストは使用するトークンで請求されます:
- 入力トークン、
- 出力トークン(推論を含む)、
- キャッシュされた入力トークン(
usage.input_tokens_details.cached_tokens)、および - キャッシュ書き込みトークン(
usage.input_tokens_details.cache_write_tokens)。
プロンプトの入力トークンが 272K を超える場合、リクエスト全体がロングコンテキストのレートで請求されます。請求は完成したレスポンスで報告された usage から差し引かれます。失敗したリクエストは請求されません。アカウントの使用記録にすべてのリクエストの正確な請求額が表示されます。
出力
非ストリーミングリクエストは公式のレスポンスオブジェクトを返します:
{
"id": "resp_...",
"object": "response",
"status": "completed",
"model": "gpt-6-luna",
"output": [{"type": "message", "role": "assistant", "content": [{"type": "output_text", "text": "..."}]}],
"usage": {"input_tokens": 27, "input_tokens_details": {"cached_tokens": 0, "cache_write_tokens": 0}, "output_tokens": 102, "output_tokens_details": {"reasoning_tokens": 0}, "total_tokens": 129}
}"stream": true の場合、レスポンスは response.created、response.output_text.delta、response.completed などの公式イベントのストリームになります。最後の response.completed イベントに使用量が含まれます。
Chat Completions
既存の Chat Completions コードは、新しいベース URL とモデル ID のみが必要です:
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
chat = client.chat.completions.create(
model="gpt-6-luna",
messages=[{"role": "user", "content": "Hello"}],
max_completion_tokens=1024,
)
print(chat.choices[0].message.content)出力の上限は max_completion_tokens で、推論強度は reasoning_effort で設定します。Chat Completions では、GPT-6 Luna は reasoning_effort が none のときのみ関数呼び出しをサポートします。推論とツールを併用する場合は Responses API を使用してください。
Anthropic Messages フォーマット
Anthropic Messages API 向けに書かれたコードからも GPT-6 Luna を呼び出せます: "model": "gpt-6-luna" を指定して Messages ボディを /v1/messages に送信します。リクエストは Chat Completions に変換されるため、Chat Completions に対応するものがないフィールドは効果がありません。レスポンスには公式の Messages フィールドが含まれ、いくつかの追加の使用量フィールドが含まれることがあります。usage.input_tokens、usage.output_tokens と公式フィールドを読んでください。
エラー
エラーは {"error": {"code": ..., "message": "..."}} を使用します。code は共通エラーカタログのコードです。失敗したリクエストは請求されません。
ヒント
- 分類や抽出では、まず
noneを試してください: 最も高速で低コストな設定です。 max_output_tokensは回答だけでなく推論にも十分な高さに設定します: これは両者のための 1 つの予算です。- 長く再利用されるコンテキストはプロンプトの先頭に置いてください。そうすれば、後のリクエストはより低いレートでキャッシュから読み込めます。
