Tin tức

Đấu trường vẽ AI: GPT-5.6 Sol đánh bại Claude, Gemini và Grok trong vẽ bút chì màu

Một bài kiểm tra đối đầu giữa bốn mô hình AI tiên tiến sử dụng bộ công cụ bút chì màu mô phỏng cho thấy GPT-5.6 Sol là người chiến thắng rõ ràng cả về chi phí lẫn chất lượng, trong khi Claude Fable 5 với chi phí cao và cách sử dụng công cụ dài dòng đã làm giảm hiệu suất.

July 22, 2026· 3 min read· Nguồn: TryAI
Đấu trường vẽ AI: GPT-5.6 Sol đánh bại Claude, Gemini và Grok trong vẽ bút chì màu

TryAI.dev đã xây dựng một đấu trường vẽ, nơi mỗi mô hình được cấp một khung vẽ trắng và một bộ công cụ bút chì màu—set_color, set_brush, set_pressure, draw, smudge, erase và view_canvas—sau đó lùi lại. Các mô hình hoặc tái tạo một hình ảnh mục tiêu (Mona Lisa, Starry Night) hoặc vẽ theo lời nhắc văn bản. Toàn bộ bộ khung là mã nguồn mở tại github.com/hershalb/canvas-arena.

Bốn mô hình thị giác đã được kiểm tra: GPT-5.6 Sol, Claude Fable 5, Grok 4.5 và Gemini 3.6 Flash. Qua hai lần tái tạo mục tiêu và năm lời nhắc mở, 28 bức vẽ đã được tạo ra. Kết quả thật tiết lộ.

Con số nổi bật

Trên tất cả bảy bức vẽ mỗi mô hình, GPT-5.6 Sol trung bình 29 bước và 7,74 đô la chi phí token, hoàn thành trong khoảng 6,2 phút. Claude Fable 5 mất 41 bước, 12,5 phút và chi phí khổng lồ 160,58 đô la—gấp hơn 20 lần chi phí của Sol. Grok 4.5 sử dụng 99 bước và 34 triệu token nhưng chỉ tốn 9,21 đô la, trong khi Gemini 3.6 Flash sử dụng 73 bước và 27,7 triệu token với giá 12,87 đô la.

Sol chưa bao giờ gọi set_color, set_brush hay set_pressure—nó đặt các giá trị đó trực tiếp trong mỗi lần gọi draw, giữ cho việc sử dụng công cụ gọn nhẹ. Grok 4.5 làm ngược lại: 65% trong số 1.349 lần gọi công cụ của nó là ba hàm setter đó. Claude Fable 5 phụ thuộc nhiều vào smudge (123 lần gọi) và liên tục xem xét. Gemini 3.6 Flash là người xem xét ám ảnh nhất, với gần một phần ba số lần gọi là view_canvas (khoảng 23 lần tự xem xét mỗi bức vẽ).

Kết quả chất lượng

Trong bản tái tạo Mona Lisa, GPT-5.6 Sol đạt điểm SSIM cao nhất, tiếp theo là Gemini 3.6 Flash, rồi Claude Fable 5, và Grok 4.5 xếp cuối. Mô hình này lặp lại với Starry Night. Đối với năm lời nhắc mở—ngư dân, hoàng hôn, hoa hồng, mèo, cabin—đầu ra của Sol luôn dễ nhận biết và mạch lạc về mặt thẩm mỹ hơn. Claude Fable 5 cho ra kết quả lộn xộn, bị nhòe quá mức. Các bức vẽ của Grok 4.5 thường khó đọc. Gemini 3.6 Flash ổn định nhưng thiếu chi tiết và bố cục của Sol.

Sự đánh đổi giữa chi phí và chất lượng

Sự chênh lệch chi phí là điểm nhấn. Claude Fable 5 tốn 160,58 đô la cho toàn bộ quá trình—gấp hơn 20 lần 7,74 đô la của GPT-5.6 Sol—nhưng lại tạo ra những bức vẽ tệ hơn. Grok 4.5 rẻ nhưng kém chất lượng. Gemini 3.6 Flash là một lựa chọn trung bình khá. Các tác giả lưu ý rằng các mô hình mã nguồn mở rẻ hơn thậm chí không thể sử dụng được, thường trả về khung vẽ trống.

Đây không phải là một điểm chuẩn về khả năng nghệ thuật. Đó là bài kiểm tra xem các mô hình này xử lý tốt như thế nào một tác vụ sử dụng công cụ mở, dài hạn. Kết quả cắt qua các điểm chuẩn và cho thấy mô hình nào thực sự có thể lập kế hoạch, lặp lại và thực thi một quy trình sáng tạo nhiều bước một cách hiệu quả.

GPT-5.6 Sol chưa bao giờ gọi set_color, set_brush hay set_pressure một lần nào—nó đặt các giá trị đó trực tiếp trong mỗi lần gọi draw, giữ cho việc sử dụng công cụ gọn nhẹ. Claude Fable 5 tốn kém hơn 20 lần và cho đầu ra tệ hơn.
Ban biên tập Manul X