Giá Grok 4.7: đầu vào được lưu đệm, suy luận và chi phí yêu cầu
Hiểu giá Grok 4.7, đầu vào được lưu đệm và mức sử dụng suy luận. Ước tính yêu cầu theo giá token hiện tại, tránh tính token lưu đệm hai lần.
Đọc dạng MarkdownGiá Grok 4.7 phụ thuộc vào token đầu vào, đầu vào được lưu đệm và mức sử dụng đầu ra. Đơn giá khởi điểm chính thức là 2 USD cho mỗi triệu token đầu vào và 6 USD cho mỗi triệu token đầu ra. Những đơn giá cơ bản đó là giá niêm yết của mô hình; khi ước tính yêu cầu SeedRouter, hãy dùng bảng giá SeedRouter hiện tại bên dưới.[1]
Độ dài hiển thị của câu trả lời chỉ là một phần phép tính. Câu trả lời ngắn có thể kèm token suy luận bổ sung, còn lời nhắc dài có thể chứa đầu vào được lưu đệm. Trang mô hình Grok 4.7 tập hợp Playground và giá hiện tại.
Grok 4.7 giá bao nhiêu?
Thông báo chính thức mô tả đơn giá đầu vào và đầu ra ở trên là giá khởi điểm của Grok 4.7. Thông báo cũng giới thiệu một biến thể fast riêng với giá khác. Hướng dẫn này đề cập mô hình grok-4.7; giá của một biến thể có tên tương tự không thể dùng thay thế.[2]
Với yêu cầu qua SeedRouter, hãy dùng các đơn giá token hiện tại sau:
Giá tạm thời không khả dụng. Vui lòng quay lại sớm.
Đọc đơn giá theo khoảng độ dài đầu vào của yêu cầu. Trên SeedRouter, đầu vào dưới 200.000 token dùng mức chuẩn; đầu vào từ 200.000 token trở lên dùng mức ngữ cảnh dài cho toàn bộ yêu cầu. Đầu vào, đầu vào được lưu đệm và đầu ra đều dùng mức tương ứng. Ngưỡng này là ranh giới giá, không phải đặt trước từng đó token.
Với service_tier: "priority" hoặc "fast", tăng gấp đôi đơn giá token của khoảng độ dài đầu vào đã chọn. Hệ số này áp dụng cho phí token; phí công cụ được tính riêng.
Tổng quan API chính thức liệt kê cửa sổ ngữ cảnh 500.000 token. Giới hạn khả năng này không có nghĩa mọi yêu cầu đều bị tính phí cho toàn bộ cửa sổ.[1]
Cần dùng những trường sử dụng nào để tính phí?
Với API Responses, giữ lại ba giá trị từ usage được trả về:
| Trường sử dụng | Cách dùng |
|---|---|
input_tokens | Tổng đầu vào, bao gồm phần được lưu đệm |
input_tokens_details.cached_tokens | Phần đầu vào được tính theo đơn giá đầu vào được lưu đệm |
output_tokens | Tổng đầu ra dùng trong phép tính token |
Trừ token được lưu đệm khỏi tổng đầu vào trước khi áp dụng đơn giá đầu vào thông thường. Nếu không, cùng một lượng token lưu đệm sẽ bị tính một lần như đầu vào thông thường và một lần nữa như đầu vào được lưu đệm trong ước tính của bạn.
Khi đơn giá được tính trên mỗi triệu token:
uncached input = input_tokens - cached_tokens
token cost = (
uncached input × input rate
+ cached_tokens × cached-input rate
+ output_tokens × output rate
) / 1,000,000Dùng đơn giá trong bảng hiện tại cho từng thành phần. Chọn khoảng độ dài đầu vào theo tổng đầu vào trước khi trừ token lưu đệm. Ước tính token không tự động bao gồm phí công cụ riêng; yêu cầu dùng công cụ tìm kiếm trả phí cần tính cả mức sử dụng đó.
Vì sao câu trả lời ngắn có thể dùng nhiều token đầu ra hơn?
Suy luận đóng góp vào mức sử dụng đầu ra ngay cả khi câu trả lời cuối cùng ngắn. Ví dụ, một yêu cầu Responses của Grok 4.7 đã hoàn tất và được xác minh ngày 10 tháng 10 năm 2026 trả về:
{
"input_tokens": 3340,
"input_tokens_details": { "cached_tokens": 1152 },
"output_tokens": 22,
"output_tokens_details": { "reasoning_tokens": 21 },
"total_tokens": 3362
}Yêu cầu này chứa 2.188 token đầu vào không được lưu đệm, 1.152 token đầu vào được lưu đệm và 22 token đầu ra. 21 token suy luận là phần chi tiết của tổng đầu ra. Cộng chúng thêm lần nữa sẽ biến 22 thành 43 và làm ước tính phí đầu ra cao hơn thực tế.
Những con số này mô tả một yêu cầu đã hoàn tất, không phải trung bình hay dự báo cho lời nhắc khác. Để lập ngân sách cho ứng dụng của mình, hãy ghi lại mức sử dụng được báo cáo qua các tác vụ tiêu biểu và kiểm tra xem từng kết quả có đáp ứng yêu cầu của tác vụ hay không.
Truyền theo luồng có làm thay đổi giá token không?
Truyền theo luồng thay đổi cách câu trả lời được gửi đến. Ước tính vẫn dùng đầu vào, đầu vào được lưu đệm và đầu ra của yêu cầu đã hoàn tất. Giữ lại thông tin sử dụng cuối cùng thay vì coi mỗi đoạn văn bản là một yêu cầu tính phí riêng.
Trong quá trình xác minh Grok 4.7 của SeedRouter, các yêu cầu Chat và Responses có và không có truyền theo luồng đều hoàn tất với đầu vào được lưu đệm được tính đúng vào mức sử dụng. Điều đó kiểm tra phép tính sử dụng; không có nghĩa hai câu trả lời được tạo riêng sẽ tiêu thụ cùng số token.
Nên so sánh chi phí của hai lời nhắc như thế nào?
Giữ nguyên tác vụ và tiêu chí nghiệm thu. Ghi lại tổng đầu vào, đầu vào được lưu đệm, đầu ra và việc câu trả lời có dùng được hay không cho mỗi lần thử. So sánh tổng chi phí để có kết quả đạt yêu cầu, bao gồm các lần tạo thành công nhưng phải lặp lại do câu trả lời chưa đạt.
Với hội thoại dài, chỉ xóa lịch sử không liên quan sau khi kiểm tra rằng phiên bản ngắn hơn vẫn trả lời chính xác. Với ngữ cảnh lặp lại, kiểm tra số token được lưu đệm; chỉ lặp lại văn bản chưa phải bằng chứng truy xuất trúng bộ nhớ đệm. Với tác vụ cần nhiều suy luận, hãy so sánh mức sử dụng đầu ra thực tế thay vì chỉ đếm từ hiển thị trong câu trả lời.
Câu hỏi về giá
Đơn giá cơ bản chính thức có phải giá tôi trả trên SeedRouter không?
Với SeedRouter, hãy dùng bảng giá cập nhật ở trên. Giá khởi điểm chính thức là thông tin tham khảo hữu ích, còn các khoảng độ dài đầu vào và đơn giá token hiện tại của dịch vụ quyết định ước tính.
Có cần cộng reasoning_tokens vào output_tokens không?
Không. Trong mức sử dụng Responses ở trên, suy luận đã nằm trong tổng đầu ra. Dùng phần chi tiết suy luận để hiểu công việc đã thực hiện, không phải để tính thêm một lần phí đầu ra.
Lặp lại lời nhắc có bảo đảm được giảm giá đầu vào lưu đệm không?
Không. Hãy dùng số token lưu đệm mà phản hồi báo cáo. Chỉ áp dụng đơn giá đầu vào được lưu đệm cho phần đó và áp dụng đơn giá đầu vào thông thường cho phần còn lại.
Có thể kiểm tra khoản phí cuối cùng ở đâu?
Bản ghi sử dụng cho biết phí của yêu cầu đã hoàn tất. Để ước tính mới, hãy làm mới mục giá Grok 4.7 và dùng mức sử dụng được báo cáo cho yêu cầu đó. Yêu cầu trả về lỗi không bị tính phí.
Nguồn
- SpaceXAI API: mô hình Grok và giá, kiểm tra ngày 10 tháng 10 năm 2026.
- Giới thiệu Grok 4.7, ngày 21 tháng 9 năm 2026.



