Grok 4.6 Đưa SpaceXAI Trở Lại Đỉnh Cao, và Rẻ
Grok 4.6 của SpaceXAI đạt 61 điểm trên Chỉ số Trí tuệ Phân tích Nhân tạo, ngang bằng GPT-5.6 Sol và chỉ sau Anthropic, đồng thời cạnh tranh về giá và vượt trội trong các tác vụ agentic.

Grok 4.6 của SpaceXAI đã ra mắt, và nó lại là một đối thủ đáng gờm. Mô hình này đạt 61 điểm trên Chỉ số Trí tuệ Phân tích Nhân tạo, tăng 5 điểm so với Grok 4.5 và nhảy vọt 23 điểm từ Grok 4.3. Điều đó đưa nó thẳng vào câu lạc bộ tiên phong, ngang bằng với GPT-5.6 Sol (max) và chỉ sau Claude Opus 5 (63) và Claude Fable 5 (62). Với một mô hình được định giá $2/$6 cho mỗi triệu token đầu vào/đầu ra, đó là một tuyên bố.
Hiệu suất agentic là điểm nhấn
Grok 4.6 không chỉ vượt trội trong suy luận tĩnh—nó tỏa sáng ở nơi các agent thực sự hoạt động. Trên GDPval-AA v2, Elo 1753 của nó chỉ sau Claude Opus 5, và nó ngang bằng về mặt thống kê với Claude Fable 5 và Qwen3.8 Max. Nó đạt 50.7% trên τ³-Banking (top hai cùng với Qwen3.8 Max ở mức 51.3%) và 88.4% trên Terminal-Bench v2.1, ngang bằng với các mô hình dẫn đầu trong các tác vụ dựa trên terminal. Ít mô hình nào mạnh đồng đều như vậy trong công việc tri thức, dịch vụ khách hàng và sử dụng terminal cùng lúc.
Hiệu quả chi phí phá vỡ khuôn mẫu
Giữ nguyên giá qua một thế hệ là điều hiếm thấy ở biên giới công nghệ. Grok 4.6 giữ mức giá $2/$6 từ Grok 4.5, trong khi các đối thủ như Claude Opus 5 ($5/$25) và GPT-5.6 Sol ($5/$30) tính phí cao hơn. Chi phí đo được cho mỗi tác vụ là $0.84, tương đương Kimi K3 nhưng với trí tuệ cao hơn, đặt nó trên đường biên Pareto về chi phí so với hiệu suất. Đối với các khối lượng công việc nặng về suy luận, giá token đầu ra chiếm ưu thế, và Grok 4.6 cắt giảm đối thủ 4-5 lần ở khía cạnh đó.
Hiệu quả trong các tác vụ dài hạn
Trên AA-Briefcase, một benchmark riêng cho công việc tri thức agentic dài hạn, Grok 4.6 ra mắt với Elo 1577—ngang tầm Fable 5, sau gia đình Claude Opus 5. Nhưng câu chuyện thực sự là hiệu quả: nó hoàn thành tác vụ trong ~53 lượt và ~0.5B token đầu vào, so với ~103 lượt và ~2.0B token của Claude Opus 5 (max). Các tác vụ dài hạn tích lũy ngữ cảnh nhanh chóng, vì vậy một mô hình sử dụng một phần tư token đầu vào có lợi thế chi phí vượt xa giá mỗi token.
Cửa sổ ngữ cảnh vẫn ở mức 500k token, và giá cache hit tăng lên $0.5 cho mỗi 1M token từ $0.3—một sự tăng nhẹ không làm giảm giá trị tổng thể.
Grok 4.6 là lời nhắc rằng biên giới không chỉ là trí tuệ thô; mà là hoàn thành công việc mà không đốt cháy ngân sách của bạn. SpaceXAI đã trở lại cuộc chơi, và nó mang theo cuộc chiến giá cả.
Grok 4.6 mang lại mức tăng 5 điểm trên Chỉ số Trí tuệ với giá $2/$6 không đổi—một động thái hiếm có ở biên giới, nơi tăng trí tuệ thường đi kèm tăng giá.
| Mô hình | Chỉ số Trí tuệ | Giá (vào/ra mỗi 1M) | Chi phí mỗi tác vụ | GDPval-AA Elo |
|---|---|---|---|---|
| Claude Opus 5 (max) | 63 | $5/$25 | — | Top |
| Claude Fable 5 (max, fallback) | 62 | — | — | — |
| Grok 4.6 | 61 | $2/$6 | $0.84 | 1753 |
| GPT-5.6 Sol (max) | 61 | $5/$30 | — | — |
| Kimi K3 | ~60 | — | $0.84 | — |
Thảo luận
0 bình luận
Hãy là người đầu tiên thảo luận.