Claude Opus 5.5 đã có trên SeedRouter

Mức độ suy luận GPT-6.1 Sol: low, medium, high, xhigh hay max?

Nên dùng mức độ suy luận nào cho GPT-6.1 Sol: thời gian, số token và chi phí thực ở low, medium, high, xhigh và max, vì sao nó chậm và nên bắt đầu từ đâu.

Đọc dạng Markdown

Hãy bắt đầu GPT-6.1 Sol ở medium, mức mặc định, và dùng low khi bạn muốn có câu trả lời nhanh. Chỉ nâng mức độ suy luận lên high, xhigh hoặc max cho những tác vụ thất bại ở medium: refactor dài, gỡ lỗi khó, công việc agent nhiều bước. Trên các tác vụ ngắn trong bài thử bên dưới, mọi mức độ suy luận đều cho đáp án đúng, nhưng max mất thời gian lâu gấp khoảng mười lần mới hiện chữ đầu tiên và dùng số token gấp hai lần rưỡi đến năm lần low.

Đó cũng là lý do chính khiến GPT-6.1 Sol có cảm giác chậm. Nó luôn suy luận trước khi trả lời, và bạn phải chờ phần suy luận đó xong mới thấy chữ đầu tiên.

GPT-6.1 Sol hỗ trợ những mức độ suy luận nào?

Năm mức: low, medium, high, xhigh và max. Mặc định là medium. Theo trang mô hình GPT-6.1 Sol của OpenAI, "các mức độ suy luận none và minimal không được hỗ trợ", nên khác với GPT-6 Sol, không có cách nào tắt suy luận. Không có none thì các tham số lấy mẫu như temperature và top_p cũng không có tác dụng.

Đặt mức độ suy luận cho từng yêu cầu. Trong Responses API, trường đó là reasoning.effort:

from openai import OpenAI

client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")

response = client.responses.create(
    model="gpt-6.1-sol",
    input="Find the race condition in this handler and suggest a fix: ...",
    reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)

Trong Chat Completions, trường này là reasoning_effort. Token suy luận được tính trong output_tokens, tính phí như đầu ra, và dùng chung ngân sách max_output_tokens với câu trả lời.

Năm mức độ suy luận khác nhau thế nào trong thực tế?

Bài thử gửi ba prompt có đáp án đã biết tới GPT-6.1 Sol qua SeedRouter ngày 5 tháng 10 năm 2026, mỗi mức độ suy luận một lần, cả năm mức cùng lúc. Thời gian tính bằng giây từ lúc gửi yêu cầu đến khi có câu trả lời hoàn chỉnh. Chi phí tính theo giá niêm yết của OpenAI là $2 đầu vào và $10 đầu ra mỗi triệu token, kiểm tra ngày 5 tháng 10 năm 2026.

Bài toán đếm — có bao nhiêu số nguyên từ 1 đến 1000 chia hết cho 3 hoặc 5 nhưng không chia hết cho 7 (đáp án: 401).

Mức độ suy luậnGiâyToken suy luậnToken đầu raChi phíĐúng
low14,051225$0,0023Có
medium13,446187$0,0020Có
high14,6134272$0,0028Có
xhigh16,2303362$0,0037Có
max20,4516574$0,0058Có

Bài toán đếm khó hơn — có bao nhiêu số nguyên từ 1 đến 99.999 là bội của 7 và không chứa chữ số 7 (đáp án: 8.434).

Mức độ suy luậnGiâyToken suy luậnToken đầu raChi phíĐúng
low17,5473711$0,0072Có
medium27,61.0311.273$0,0128Có
high28,31.0341.255$0,0126Có
xhigh31,21.5521.763$0,0177Có
max42,62.0702.259$0,0227Có

Rà soát mã — tìm lỗi trong một hàm Python median bốn dòng, hàm này sắp xếp đầu vào tại chỗ và xử lý sai danh sách có độ dài chẵn.

Mức độ suy luậnGiâyToken suy luậnToken đầu raChi phíTìm ra cả hai lỗi
low14,976221$0,0023Có, kèm phiên bản đã sửa
medium15,491194$0,0020Có
high19,5296396$0,0040Có
xhigh19,5516606$0,0061Có
max28,41.0341.114$0,0112Có

Đây là các lần chạy đơn lẻ trên tác vụ ngắn, nên hãy xem chúng như thước đo về quy mô, không phải benchmark. Số token suy luận thay đổi giữa các lần chạy, và chính các tác vụ khó hơn mới là nơi mức độ suy luận cao hơn xứng đáng với chi phí.

Vì sao GPT-6.1 Sol chậm?

Phần lớn thời gian chờ là suy luận, và suy luận diễn ra trước. Một bài thử thứ hai stream cùng một bài giải thích 300 từ ở ba mức độ suy luận và đo thời điểm chữ hiển thị đầu tiên xuất hiện:

Mức độ suy luậnChữ đầu tiên sauTổng thời gianToken suy luậnTốc độ trả lời
low3,0 s20,5 s5625 token/s
medium13,6 s24,7 s82440 token/s
max30,6 s43,5 s2.51734 token/s

Khi câu trả lời đã bắt đầu, nó stream với tốc độ tương tự ở mọi mức. Điều thay đổi là khoảng im lặng trước đó: ở max, mô hình dành nửa phút suy luận trước khi viết bất cứ thứ gì. Nếu người dùng của bạn phải nhìn biểu tượng chờ, low kèm streaming là thiết lập có cảm giác nhanh nhất.

OpenAI cũng đã công bố GPT-6.1 Sol Ultrafast, với "tốc độ sinh token nhanh hơn tới 8 lần so với tốc độ tiêu chuẩn trong Codex", trong bài ra mắt.

xhigh hay max có thể tệ hơn medium không?

Trên một tác vụ cụ thể thì có: mức độ suy luận cao hơn không đảm bảo câu trả lời tốt hơn. Trong các lần chạy ở trên, max chưa bao giờ đúng hơn low, nó chỉ tốn hơn. Kết quả của chính OpenAI cũng cho thấy điều tương tự với công việc thường ngày: GPT-6.1 Sol vượt điểm DeepSWE tốt nhất của GPT-6 Sol "ở mức độ suy luận thấp hơn", và mức cải thiện tính chính xác lớn nhất so với GPT-6 Sol đến ở mức low.

Trong số liệu của OpenAI, mức độ suy luận cao hơn có lợi ở công việc dài và khó: kết quả OSWorld 2.0 và Terminal-Bench Science của GPT-6.1 Sol được báo cáo ở mức tối đa. Quy tắc thực tế là đo trên tác vụ của chính bạn. Chạy một mẫu ở medium và ở mức cao hơn một bậc, và chỉ giữ mức cao hơn ở những chỗ nó sửa được lỗi.

Nên dùng mức độ suy luận nào?

  • low — trả lời chat, phân loại, trích xuất, chỉnh sửa mã đơn giản, bất cứ thứ gì người dùng phải chờ.
  • medium — mặc định cho hỗ trợ lập trình, rà soát mã và phần lớn các bước agent.
  • high — thay đổi nhiều file và gỡ lỗi thất bại ở medium.
  • xhigh — refactor dài và lập kế hoạch qua nhiều bước.
  • max — những bài toán khó nhất, nơi một câu trả lời sai tốn kém hơn số token thêm.

Với cả một agent, hãy kết hợp các mức: lập kế hoạch ở mức cao hơn, chạy các bước công cụ thường ngày ở low hoặc medium. Giá cho mọi mức có trên trang GPT-6.1 Sol, và hướng dẫn giá GPT-6.1 Sol giải thích token suy luận xuất hiện trên hóa đơn như thế nào.

Câu hỏi thường gặp

Mức độ suy luận mặc định của GPT-6.1 Sol là gì?

medium. Nếu bạn bỏ trống trường này, GPT-6.1 Sol suy luận ở mức medium.

GPT-6.1 Sol nên dùng low hay medium?

Dùng medium làm mặc định và low khi tốc độ quan trọng hơn độ sâu. Trong bài thử ở trên, low trả lời đúng mọi câu hỏi và hiện chữ đầu tiên sau khoảng ba giây, so với khoảng mười bốn giây ở medium.

Vì sao GPT-6.1 Sol chậm như vậy?

Nó suy luận trước khi trả lời, và phần suy luận không được stream dưới dạng văn bản. Từ medium trở lên, giai đoạn im lặng đó chiếm phần lớn thời gian chờ. Hạ mức độ suy luận hoặc stream phản hồi để chữ hiện ra sớm hơn.

GPT-6.1 Sol xhigh có tốt hơn high không?

Chỉ trên những tác vụ cần đến nó. Trên tác vụ ngắn, cả hai mức cho cùng đáp án, và xhigh dùng nhiều token hơn. Hãy thử cả hai trên công việc của chính bạn trước khi trả tiền cho xhigh.

Có tắt được suy luận trong GPT-6.1 Sol không?

Không. GPT-6.1 Sol không hỗ trợ none hay minimal. Nếu bạn cần câu trả lời không qua suy luận, GPT-6 Sol vẫn hỗ trợ none. Xem so sánh GPT-6.1 Sol vs GPT-6 Astra vs GPT-6 Sol.

Hướng dẫn liên quan