Grok 4.7: thông số, năng lực, benchmark và giá Modelflare

Hướng dẫn có nguồn về Grok 4.7: thông số đã công bố, mức suy luận, benchmark lúc ra mắt, giá token chính thức, cùng giá grok-award và grok-stable của Modelflare đã kiểm tra ngày 21 tháng 9 năm 2026.

xAI phát hành Grok 4.7 vào ngày 21 tháng 9 năm 2026. ID mô hình trên API là grok-4.7. Đây là mô hình chủ lực hiện tại của xAI cho lập trình, dùng công cụ theo kiểu agent và công việc tri thức. Modelflare đã liệt kê đúng ID đó trong danh mục giá công khai vào cùng ngày.

Bài viết này giữ ba lớp tách riêng. Thông số là những gì xAI ghi trong tài liệu. Bảng benchmark là những gì xAI báo cáo lúc ra mắt. Giá của Modelflare là những gì GET /api/pricing trả về vào ngày 21 tháng 9 năm 2026. Một điểm số của nhà cung cấp không phải bài kiểm tra của Modelflare, và một dòng danh mục không phải lời hứa rằng mọi khóa, tuyến hay prompt sẽ hành xử giống nhau.

xAI chưa công bố số lượng tham số, số lớp, hay tổng token huấn luyện của Grok 4.7. "Lớn hơn Grok 4.6" là mô tả định tính của công ty về mô hình nền mới. Phần so sánh bên dưới dùng những con số thực sự được công bố: ngữ cảnh, giá token, mức suy luận, phương thức và điểm lúc ra mắt.

Những gì đã được công bố

Bài đăng ra mắt mô tả Grok 4.7 là một mô hình nền mới, lớn hơn Grok 4.6, được huấn luyện bằng một lượt học tăng cường dài hơn. Tổ hợp tác vụ khó hơn và được đặt trọng số vào các bài toán mất nhiều giờ. xAI nói mô hình kiểm tra công việc của chính nó tốt hơn, quản lý ngữ cảnh dài tốt hơn, và được huấn luyện để hiểu harness Grok Bot dùng cho công việc hội thoại.

Hai câu trong bài đăng đó không nên gộp thành một. Dòng tiêu đề nói mô hình "nhanh gấp đôi, với một nửa giá của các mô hình tương đương". Phần thân nói mô hình được phục vụ với cùng giá và cùng tốc độ như Grok 4.6. Bảng token hậu thuẫn câu thứ hai khi đối chiếu với Grok 4.6: cả hai đều liệt kê $2 cho mỗi một triệu token đầu vào và $6 cho mỗi một triệu token đầu ra. Dòng tiêu đề là phép so sánh với các mô hình khác trong bảng đó, vốn có giá niêm yết cao hơn. xAI không công bố số token mỗi giây bên cạnh cụm "nhanh gấp đôi", nên bài viết này không coi cụm đó là một kết quả độ trễ đã đo.

grok-4.7 có trên API của xAI, trong Cursor, và là mô hình mặc định trong Grok Build. Một đường phục vụ Fast riêng chỉ tồn tại trong Cursor và Grok Build. Đường đó không có trên API công khai của xAI, và không có trong danh mục Modelflare đã kiểm tra cho bài viết này.

So sánh thông số

Giá bên dưới là giá niêm yết mà xAI đã công bố, tính bằng USD cho mỗi một triệu token. "Ngắn" nghĩa là prompt dưới 200,000 token. "Dài" nghĩa là prompt đã chạm 200,000 token. Trên bảng giá, vượt qua mốc đó định giá lại mọi token trong yêu cầu, không chỉ những token vượt mốc.

Hạng mục grok-4.7 grok-4.6 grok-4.5
Cửa sổ ngữ cảnh 500,000 token 500,000 token 500,000 token
Đầu vào ngắn / đầu vào đã cache / đầu ra $2.00 / $0.50 / $6.00 $2.00 / $0.50 / $6.00 $2.00 / $0.30 / $6.00
Đầu vào dài / đầu vào đã cache / đầu ra $4.00 / $1.00 / $12.00 $4.00 / $1.00 / $12.00 $4.00 / $0.60 / $12.00
Mức nỗ lực suy luận low, medium, high (mặc định), xhigh low, medium, high (mặc định), xhigh low, medium, high (mặc định)

Chi tiết Grok 4.7 đã kiểm tra trên trang mô hình cùng ngày:

  • Đầu vào là văn bản và hình ảnh. Đầu ra là văn bản. Mô hình không tạo hình ảnh.
  • Trang không nêu giới hạn đầu ra văn bản cố định. Thời gian chờ của client, giới hạn tài khoản và phần cửa sổ ngữ cảnh còn lại vẫn áp dụng.
  • Mốc kiến thức là tháng 5 năm 2026. Sự kiện muộn hơn không thấy được trừ khi một công cụ tìm kiếm được bật.
  • Giao diện được ghi trong tài liệu là Responses API và Chat Completions.
  • Công cụ được ghi trong tài liệu gồm function calling, tìm kiếm web, tìm kiếm X và thực thi mã.
  • Không thể tắt suy luận. Nếu bỏ mức nỗ lực, mặc định là high.
  • Trên Responses API, grok-4.7 trả về reasoning.encrypted_content ngay cả khi yêu cầu không xin trường đó. Các lượt sau phải gửi lại những mục suy luận đó mà không thay đổi. Chat Completions không có hành vi này.

Grok 4.5 dừng ở high. Grok 4.6 và Grok 4.7 thêm xhigh. Giá niêm yết của đầu vào đã cache cũng đổi: Grok 4.5 là $0.30 với prompt ngắn và $0.60 với prompt dài; Grok 4.6 và Grok 4.7 là $0.50 và $1.00. Giá niêm yết đầu vào và đầu ra tiêu chuẩn không đổi trên cả ba ID này.

Các chiều năng lực

Lập trình và công việc agent dài

Bài đăng ra mắt nhắm Grok 4.7 vào công việc chạy trong thời gian dài: lập trình nhiều bước, kiểm tra kết quả trước khi coi là xong, và giữ một ngữ cảnh dài gắn với nhau. Tất cả điểm lập trình này đều lấy từ bảng ra mắt của xAI:

  • CursorBench 4.0, vốn gây áp lực lên các tác vụ lập trình dài hơn: 46.3% ở xHigh. Grok 4.6 High là 40.4%, GPT-5.6 Sol Max là 41.7%, và Fable 5.1 Max là 51.8%.
  • DeepSWE v1.1: 71.0%, được xAI đánh dấu là điểm mức nỗ lực cao chứ không phải xHigh. Grok 4.6 là 65.2%, Sol là 72.7%, và Fable 5.1 là 70.0%.
  • Terminal-Bench 4.0: 38.0%. Grok 4.6 là 20.3%, Sol là 37.3%, và Fable 5.1 là 57.9%.
  • EEBench, kỹ thuật điện: 64.0%. Grok 4.6 là 53.0%, Sol là 39.4%, và Fable 5.1 là 56.4%.

Hãy đọc các hàng như một bản đồ những chỗ nhà cung cấp nói mô hình đã dịch chuyển, không phải điểm mà kho mã của bạn sẽ đạt được. Trên CursorBench, xAI gọi kết quả là tỷ lệ giá-hiệu năng ở mức frontier: điểm cao hơn Sol và Grok 4.6, thấp hơn Fable 5.1, với giá niêm yết thấp hơn nhiều so với cả Sol lẫn Fable. DeepSWE gần Fable và vẫn thấp hơn Sol, và đó không phải con số xHigh. Công việc terminal cải thiện mạnh so với Grok 4.6 và nằm gần Sol, trong khi Fable 5.1 vẫn vượt xa trên hàng đó. EEBench là vị trí dẫn đầu rõ nhất trong bảng.

Công việc tri thức chuyên môn

xAI cũng báo cáo các tác vụ văn phòng và chuyên môn:

  • AA Briefcase v1.1, công việc văn phòng nhiều giờ: 1,657. Grok 4.6 là 1,546, Sol là 1,487, và Fable 5.1 là 1,678.
  • Harvey Legal Agent Benchmark: 19.6%. Grok 4.6 là 15.8%, Sol là 2.5%, và Fable 5.1 là 6.7%. Dẫn đầu bảng này vẫn có nghĩa là khoảng một trong năm mục. Đó không phải bằng chứng rằng mô hình có thể đảm nhận công việc pháp lý khi không có người giám sát.
  • HealthBench Professional, suy luận lâm sàng: 56.7%. Grok 4.6 là 48.5%, Sol là 60.5%, và Fable 5.1 là 62.1%. Trên hàng này Grok 4.7 đứng trước phiên bản trước của nó và đứng sau cả hai mô hình so sánh.

Bài đăng nói Grok 4.7 tốt hơn với tài liệu và bài thuyết trình, và cải thiện so với Grok 4.6 trên GDPval trong khi nằm cùng khoảng với các mô hình frontier khác. Phần văn không in các giá trị điểm GDPval, nên bài viết này không cung cấp giá trị nào.

Không có một chỉ số trí tuệ duy nhất trong văn bản ra mắt Grok 4.7. Bài đăng trước đó về Grok 4.6 đã công bố Artificial Analysis Intelligence Index. Lần ra mắt này thay con số duy nhất đó bằng bảng tác vụ ở trên. Hãy dùng hàng khớp với công việc. Một mô hình có thể dẫn đầu kỹ thuật điện và đi sau ở suy luận lâm sàng trong cùng một lần phát hành.

Mức nỗ lực suy luận

reasoning_effort nhận low, medium, highxhigh. high là mặc định. xAI mô tả low là mức nhẹ hơn, medium là suy nghĩ nhiều hơn ở chỗ độ trễ ít nhạy cảm hơn, high là mức cho các bài toán nhiều bước khó, và xhigh là mức sâu nhất, với độ trễ cao nhất, cho các bài toán mà chất lượng câu trả lời quan trọng hơn thời gian phản hồi.

Nỗ lực nhiều hơn thường có nghĩa là nhiều token suy luận hơn, và token đầu ra là phía đắt của giá niêm yết. xhigh không tự động là mặc định production đúng. Hãy so sánh mức thành công của tác vụ, độ trễ và tổng token trên chính prompt của bạn trước khi để mức đó luôn bật.

Với một hội thoại Responses nhiều lượt, hãy giữ các mục suy luận đã mã hóa trong yêu cầu tiếp theo. Bỏ chúng đi là bỏ ngữ cảnh mà mô hình đã dùng để tới câu trả lời trước. Chat Completions không trả về trường đã mã hóa đó.

Công cụ, hình ảnh và bộ nhớ

Function calling là đường công cụ do bạn triển khai. Bạn khai báo hàm, mô hình đề xuất một lần gọi, ứng dụng của bạn chạy hàm đó, rồi bạn gửi kết quả trở lại. Tìm kiếm web, tìm kiếm X và thực thi mã do xAI lưu trữ. Mô hình có thể tự gọi chúng, và mỗi lần gọi được tính giá riêng khỏi token.

Có thể gửi hình ảnh làm đầu vào. Tóm tắt trang mô hình không liệt kê một giá hình ảnh riêng. Đầu vào hình ảnh tiêu thụ ngữ cảnh và xuất hiện trong lượng token đã dùng của yêu cầu. Việc tạo hình ảnh vẫn nằm ở các mô hình Grok Imagine, đó là một API khác.

Năm trăm nghìn token là cửa sổ, không phải ngân sách bạn nên lấp đầy. xAI khuyến nghị một prompt_cache_key ổn định trên Responses API, và header x-grok-conv-id trên Chat Completions trực tiếp, để một hội thoại có nhiều khả năng rơi vào cùng một máy chủ và trúng cache. Không có sự gắn kết đó, một máy chủ có cache lạnh sẽ tính đủ giá đầu vào. Các vòng lặp dài cũng được kỳ vọng sẽ nén các lượt cũ hơn. Việc nén thay đổi những gì mô hình có thể thấy. Hãy đối chiếu bản tóm tắt với các ràng buộc gốc, các ID, các quyết định và các lỗi còn mở.

Mốc tháng 5 năm 2026 là giới hạn cứng đối với tri thức đã ghi nhớ. Bất cứ điều gì mới hơn đều cần một công cụ tìm kiếm, và tìm kiếm không nằm trong giá token.

Lớp bảo vệ

xAI nói Grok 4.7 dùng một chồng lớp bảo vệ mới và là mô hình mạnh nhất mà hãng đã kiểm tra về từ chối và khả năng chống jailbreak. Hai con số được in trong bài đăng ra mắt:

  • Benchmark an toàn sinh học của LatchBio: 62.4%.
  • HackerBench v0.3, mà xAI mô tả là benchmark của hãng về các tác vụ mạng rủi ro và độc hại: 3.3% prompt lưỡng dụng rủi ro được cho đi qua. xAI cũng nói công việc bảo mật hợp pháp hiếm khi bị chặn.

Bài đăng nói các đối tác an ninh mạng được chọn có quyền truy cập chỉ theo lời mời vào năng lực red team cho nghiên cứu phòng thủ. Quyền truy cập đó không thuộc API công khai grok-4.7 được mô tả ở đây.

Những con số này là đánh giá của nhà cung cấp. Chúng không phải một cuộc kiểm toán độc lập, và không phải lý do để bỏ qua việc người xem lại các câu trả lời y khoa, pháp lý, bảo mật hoặc các câu trả lời có rủi ro cao khác.

Giá chính thức

Mức giá token

Trang giá xAI, đã kiểm tra ngày 21 tháng 9 năm 2026, liệt kê USD cho mỗi một triệu token:

Kích thước prompt Đầu vào Đầu vào đã cache Đầu ra
Dưới 200,000 token prompt $2.00 $0.50 $6.00
Từ 200,000 token prompt trở lên $4.00 $1.00 $12.00

Mức giá dài bao trùm toàn bộ yêu cầu khi prompt chạm ngưỡng. 200,000 token đầu tiên không giữ mức giá ngắn.

Ba ví dụ chính thức

Phí công cụ được lưu trữ không được tính vào.

Yêu cầu Cơ sở Phép tính Tổng
100,000 đầu vào chưa cache, 5,000 đầu ra Ngắn 0.1 × $2 + 0.005 × $6 $0.230
100,000 đầu vào đã cache, 5,000 đầu ra Ngắn 0.1 × $0.50 + 0.005 × $6 $0.080
220,000 đầu vào chưa cache, 10,000 đầu ra Dài 0.22 × $4 + 0.01 × $12 $1.000

Bước nhảy từ hàng đầu sang hàng thứ ba không phải là "thêm một chút văn bản". Vượt 200,000 token nhân đôi mọi mức giá, và các token thêm được tính theo mức đã nhân đôi. Một prompt 100,000 token được cache toàn bộ ở hàng thứ hai có giá khoảng một phần ba prompt ngắn chưa cache, vì đầu vào đã cache bằng một phần tư mức giá đầu vào và khoản tính cho đầu ra không đổi.

Công cụ được lưu trữ, Fast và khu vực Hoa Kỳ

Các lần gọi công cụ được lưu trữ trên cùng trang giá:

  • Tìm kiếm web (web_search): $5 cho mỗi 1,000 lần gọi.
  • Tìm kiếm X (x_search): $5 cho mỗi 1,000 lần gọi tại thời điểm kiểm tra này. Bắt đầu từ ngày 21 tháng 9 năm 2026 lúc 12:00 PT, xAI thay giá theo lần gọi đó bằng $5 cho mỗi 1,000 bài đăng được lấy về và $10 cho mỗi 1,000 hồ sơ người dùng được lấy về. Mọi bài đăng được trả về đều được tính, kể cả bài cha và trích dẫn. Mọi hồ sơ được trả về đều được tính.
  • Thực thi mã (code_executioncode_interpreter): $5 cho mỗi 1,000 lần gọi.
  • Tìm kiếm tệp đính kèm: $10 cho mỗi 1,000 lần gọi.
  • Tìm kiếm bộ sưu tập: $2.50 cho mỗi 1,000 lần gọi.

Mô hình tự chọn số lần gọi được lưu trữ. Một câu trả lời nặng về tìm kiếm có thể tốn phí công cụ nhiều hơn phí token.

Endpoint khu vực Hoa Kỳ https://us.api.x.ai/v1 giữ suy luận ở Hoa Kỳ và nhân đầu vào, đầu vào đã cache và đầu ra với 1.1, kể cả các mức ngữ cảnh dài. Với grok-4.7, đó là $2.20 / $0.55 / $6.60 khi dưới 200,000 token prompt, và $4.40 / $1.10 / $13.20 tại hoặc trên mốc đó.

Grok 4.7 Fast là cùng một mô hình trên hạ tầng nhanh hơn. Văn của xAI nói mô hình được tính giá gấp đôi mức token tiêu chuẩn. Bảng giá in $4.00 / $1.00 / $12.00 dưới 200,000 token prompt, và $6.00 / $1.50 / $18.00 tại hoặc trên 200,000. Nhân đôi hàng ngữ cảnh dài tiêu chuẩn $4 / $1 / $12 sẽ ra $8 / $2 / $24. Hàng ngữ cảnh dài của Fast được in ra không khớp với phép nhân đôi đó. Hãy lập ngân sách từ bảng, và kiểm tra lại trang giá trước khi dựa vào Fast. Fast được bán qua Cursor và Grok Build. Fast không có trên API công khai của xAI, không nằm trong bậc miễn phí của Grok Build, và danh mục Modelflare đã kiểm tra ngày 21 tháng 9 năm 2026 không có ID mô hình Fast. Các ID Grok có mặt là grok-4.5, grok-4.6grok-4.7.

Benchmark lúc ra mắt

Các điểm bên dưới được chép từ bài đăng ra mắt của xAI ngày 21 tháng 9 năm 2026. Folkbench so sánh các tuyến theo độ sẵn sàng, độ trễ và giá, và giữ ghi chú về mô hình này tại folkbench.com/models/grok-4-7. Tiêu đề cột giữ mức nỗ lực mà xAI đã in. Điểm của các mô hình khác là những điểm xAI đặt vào cùng bảng. Modelflare không chạy lại chúng.

Đánh giá Grok 4.7 xHigh Grok 4.6 High GPT-5.6 Sol Max Fable 5.1 Max
Giá niêm yết đầu vào, USD / 1M 2 2 4 10
Giá niêm yết đầu ra, USD / 1M 6 6 20 50
CursorBench 4.0 46.3% 40.4% 41.7% 51.8%
DeepSWE v1.1 71.0% (high, không phải xHigh) 65.2% 72.7% 70.0%
EEBench 64.0% 53.0% 39.4% 56.4%
AA Briefcase v1.1 1,657 1,546 1,487 1,678
Terminal-Bench 4.0 38.0% 20.3% 37.3% 57.9%
Harvey Legal Agent Benchmark 19.6% 15.8% 2.5% 6.7%
HealthBench Professional 56.7% 48.5% 60.5% 62.1%

Cột Grok 4.7 không phải một mức nỗ lực duy nhất. DeepSWE được nêu rõ là điểm mức nỗ lực high. Các ô Grok 4.7 còn lại nằm dưới tiêu đề xHigh. Grok 4.6 là High. Sol và Fable là Max. Một điểm cao hơn có thể đến từ mức suy luận sâu hơn và đắt hơn. Điều đó đáng biết, và đây không phải phép so sánh đã khớp ở một mức nỗ lực duy nhất.

Trên bảng này Grok 4.7 dẫn đầu EEBench và benchmark Harvey. Mô hình này gần những mô hình dẫn đầu trên CursorBench, DeepSWE, AA Briefcase, và trên Terminal-Bench khi đối chiếu với Sol. Mô hình này thua Fable 5.1 một khoảng rộng trên Terminal-Bench, và thua cả Sol lẫn Fable 5.1 trên HealthBench Professional.

Giá niêm yết đầu vào bằng một nửa của Sol và một phần năm của Fable. Giá niêm yết đầu ra bằng 30% của Sol và 12% của Fable. "Một nửa giá" khớp với ô đầu vào của Sol và không khớp với mọi ô khác. Bảng mới là phép so sánh chính xác.

Giá Modelflare và các nhóm khác nhau thế nào

Ngày 21 tháng 9 năm 2026, phản hồi giá công khai của Modelflare có grok-4.7. Mức niêm yết của danh mục khớp với giá niêm yết ngữ cảnh ngắn của xAI: đầu vào $2 cho mỗi một triệu token, hệ số hoàn thành là 3 nên đầu ra là $6, và hệ số cache là 0.25 nên đầu vào đã cache là $0.50. Dòng đó không công bố một bậc ngữ cảnh dài thứ hai. Đừng nhân mức dài $4 / $1 / $12 của xAI với hệ số nhóm của Modelflare rồi coi tích số đó là hóa đơn. Khoản đã ghi trên yêu cầu hoàn tất mới là con số đã được áp dụng.

Nhóm được chọn trên khóa API. Cả hai nhóm đều gọi cùng một ID mô hình.

Bảng giá

Nhóm Hệ số Đầu vào / 1M Đầu vào đã cache / 1M Đầu ra / 1M Mô tả trong danh mục
grok-award 0.03 $0.06 $0.015 $0.18 Định tuyến ưu tiên giá cho phát triển, kiểm thử và khối lượng công việc linh hoạt, nhạy với ngân sách và có thể thử lại
grok-stable 0.11 $0.22 $0.055 $0.66 Phát triển hằng ngày, các dự án dài hơn, và ứng dụng production cho nhà phát triển cá nhân muốn sự ổn định

Phép tính là mức niêm yết của danh mục nhân với hệ số nhóm. Award là $2.00 × 0.03, $0.50 × 0.03 và $6.00 × 0.03. Stable là $2.00 × 0.11, $0.50 × 0.11 và $6.00 × 0.11. So với giá niêm yết ngữ cảnh ngắn, các hệ số đó là 3% và 11%. Chúng không phải 3% hay 11% của giá niêm yết ngữ cảnh dài, của giá khu vực Hoa Kỳ, hay của phí công cụ được lưu trữ.

Văn bản danh mục tiếng Trung cho grok-award thêm một câu mà mô tả tiếng Anh không có: giá rất thấp không bảo đảm sự ổn định hoặc chất lượng mô hình. Hãy giữ câu đó cạnh hệ số 0.03. grok-stable là mô tả của danh mục cho phát triển và production thông thường. Không câu nào trong hai câu đó là một thỏa thuận thời gian hoạt động đã đo, một mục tiêu độ trễ, hay một khẳng định rằng các nhóm chạy các trọng số khác nhau.

Ba ví dụ Modelflare

Hình dạng token khớp với các ví dụ chính thức. Chúng được tính giá theo mức đơn của danh mục. Các hàng đã cache giả định bản ghi mức dùng tính những token đầu vào đó là lần trúng cache. Các khoản rất nhỏ cũng có thể xê dịch khi hạn mức được làm tròn tới đơn vị tính phí, nên nhật ký yêu cầu vẫn là hóa đơn.

Yêu cầu grok-award grok-stable
100,000 đầu vào chưa cache, 5,000 đầu ra $0.0069 $0.0253
100,000 đầu vào đã cache, 5,000 đầu ra $0.0024 $0.0088
220,000 đầu vào chưa cache, 10,000 đầu ra, theo mức đơn của danh mục $0.0150 $0.0550

Hàng 220,000 token cố ý không phải 0.03 × $1.00 hay 0.11 × $1.00. Một đô la là khoản niêm yết ngữ cảnh dài của xAI. Nếu một bản sửa danh mục về sau thêm bậc ngữ cảnh dài, hàng này không còn là báo giá. Trang trực tiếp là trang giá grok-4.7. Mục lục là Mô hình & Giá.

Gọi mô hình qua Modelflare, thay vì mở một tài khoản xAI riêng chỉ cho ID này, có nghĩa là:

  • ID mô hình vẫn là grok-4.7. Phía client không nhắm vào một bí danh đã đổi tên.
  • URL cơ sở chuẩn là https://modelflare.dev/v1 tương thích OpenAI. SDK OpenAI thường cần URL cơ sở đó, một khóa Modelflare và ID mô hình.
  • Khóa được đặt trong grok-award hoặc grok-stable. Cùng một tài khoản có thể gọi các mô hình khác trong danh mục khi nhóm của khóa cho phép.
  • Cách tách giá được nêu rõ. Award là tuyến rẻ cho công việc bạn có thể thử lại, với lưu ý về ổn định và chất lượng ở trên. Stable là tuyến mà danh mục mô tả cho phát triển hằng ngày và production.
  • Các loại endpoint được liệt kê cho ID này là Chat Completions, Responses và compaction của Responses.

Mức giá này không bao gồm một lợi thế độ trễ đã đo so với việc gọi xAI trực tiếp, phí tìm kiếm hoặc thực thi mã được lưu trữ, bậc phục vụ Fast, hay một mức dịch vụ vượt ngoài mô tả nhóm.

Cách gọi Grok 4.7 trên Modelflare

Tạo một khóa API và chọn grok-award hoặc grok-stable. Nhóm nằm trên khóa. Một khóa thuộc nhóm không liên quan có thể thất bại trên grok-4.7 dù mô hình được liệt kê công khai. Hãy gửi đúng ID mô hình. URL cơ sở chuẩn là https://modelflare.dev/v1. Cùng API đó cũng được công bố tại https://cf.modelflare.dev/v1https://origin.modelflare.dev/v1. Tên máy chủ gốc là site chuẩn.

Chat Completions:

export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.7",
    "reasoning_effort": "high",
    "messages": [
      {
        "role": "user",
        "content": "Review this migration plan and list the three assumptions that most need a test."
      }
    ]
  }'

Responses:

curl -sS https://modelflare.dev/v1/responses \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.7",
    "reasoning": {"effort": "high"},
    "input": "Review this migration plan and list the three assumptions that most need a test."
  }'

Trên Chat Completions, reasoning_effort nhận low, medium, highxhigh. Trên Responses, đặt reasoning.effort bằng các giá trị đó. Đầu vào hình ảnh dùng mảng nội dung OpenAI thông thường trên một tin nhắn người dùng. Hàm của riêng bạn dùng trường tools thông thường. POST /v1/responses/compact được liệt kê cho mô hình này và được chuyển tiếp như compaction trên grok-4.7, không phải như một ID mô hình khác. Các công cụ xAI được lưu trữ, gồm tìm kiếm web, là hành vi của nhà cung cấp. Hãy thử chúng trên tuyến bạn sẽ thực sự dùng, và đọc bản ghi mức dùng, trước khi phụ thuộc vào chúng hoặc vào phí mỗi lần gọi của xAI.

Về khác biệt giữa hai dạng yêu cầu, xem Responses API so với Chat Completions. Về phương pháp chi phí phía sau các bảng, xem Cách tính chi phí token LLMTheo dõi chi phí API AI.

Việc cần kiểm tra trước khi chuyển lưu lượng

  1. Ghim grok-4.7. Đừng chấp nhận sự thay thế im lặng bằng Grok 4.6 hoặc Grok 4.5.
  2. Xác nhận nhóm của khóa là grok-award hoặc grok-stable, và chọn theo mức chịu được việc thử lại chứ không chỉ theo hệ số.
  3. Chạy lại một bộ cố định, không chứa dữ liệu nhạy cảm, ở low, medium, highxhigh. Ghi lại thành công, độ trễ, token đầu vào, đầu vào đã cache, token đầu ra và khoản phí.
  4. Chạy Grok 4.6 trên cùng bộ đó trước khi thay thế. Giá niêm yết thì tương tự. Bảng điểm thì không đồng đều.
  5. Tính giá một prompt ngay dưới 200,000 token và một prompt ngay trên mốc đó, rồi đọc khoản đã ghi. Bảng của xAI và dòng danh mục Modelflare hiện không công bố cùng một quy tắc ngữ cảnh dài.
  6. Nếu quy trình cần hình ảnh, lệnh gọi hàm, streaming hoặc hủy, hãy thử các đường đó. Một lần thành công chỉ có văn bản không bao trùm chúng.
  7. Giữ một tuyến hoàn tác. Một phản hồi HTTP đã hoàn tất chỉ cho thấy một lần gọi đã kết thúc.

Nguồn

Đã kiểm tra ngày 21 tháng 9 năm 2026.