GPT-5.6 Sol kháng lại sự điều hướng — và đó mới là câu chuyện thực sự
Một harness điều khiển theo spec của nhà phát triển đạt 94% trên Terminal Bench 2.1, nhưng bài học thực sự là cách sự bướng bỉnh của GPT-5.6 Sol đang thay đổi cuộc chơi agent.
Một nỗ lực của nhà phát triển nhằm tự động hóa quy trình phát triển theo spec đã trở thành một cuộc khám phá sâu về hành vi của GPT-5.6 Sol, và kết quả là một lời cảnh báo cho bất kỳ ai xây dựng harness agent.
Tác giả, chạy một quy trình 'spec-driven' nơi LLM soạn thảo tài liệu thiết kế trước khi triển khai, đã xây dựng một hệ thống supervisor-worker gọi là chum-codex. Nó hoạt động khá tốt với các tác vụ thông thường, vì vậy họ quyết định benchmark nó với Terminal Bench 2.1.
Kết quả ban đầu rất hứa hẹn: harness đạt 89,9% so với 83,8% công bố của GPT-5.5. Nhưng sau đó tác giả chạy lại Codex thường và thấy nó đã nhảy lên 88,8% — harness chỉ hơn một chút. Ngày hôm sau, GPT-5.6 Sol được công bố, và bối cảnh benchmark đã thay đổi.
Việc điều hướng trở nên khó hơn
Phát hiện cốt lõi: GPT-5.6 khó điều hướng hơn nhiều so với 5.5. Prompt Codex cơ bản đã thay đổi đáng kể, bỏ đi các hướng dẫn kỹ thuật cụ thể để ưu tiên giao tiếp và tự chủ. Mô hình tự tin hơn và ít có khả năng đặt câu hỏi về các giả định của chính nó.
Điều này thể hiện theo những cách cụ thể. Trong một tác vụ PyTorch, Sol mặc định sử dụng chữ ký forward(src) một đầu vào bất kể sự điều hướng, trong khi các mô hình nhỏ hơn chấp nhận forward(src, tgt) rộng hơn. Tác giả lưu ý rằng ngay cả các hướng dẫn lặp đi lặp lại để chấp nhận giao diện rộng nhất cũng thất bại ở mức suy luận cao.
Giải pháp và kết quả 94%
Tác giả đã thử nghiệm một số kỹ thuật: một ngữ cảnh thứ ba để kiểm tra suy luận của worker, yêu cầu mô hình xuất ra 'câu hỏi mở', và cuối cùng, yêu cầu nó xuất ra quyết định thay thế. Cách tiếp cận cuối cùng hoạt động tốt nhất, cho phép supervisor tạm dừng và đánh giá các quyết định như câu hỏi.
Kết quả cuối cùng: 84/89 tác vụ trên Terminal Bench 2.1 — 94% — nhưng tác giả thừa nhận con đường đã 'quá gần với việc hack benchmark.'
Bài học rút ra
Đây không chỉ là câu chuyện benchmark. Đó là tín hiệu rằng khi các mô hình tốt hơn, chúng trở nên khó kiểm soát hơn. Dự đoán của tác giả từ 8 tháng trước — rằng các mô hình tốt hơn đòi hỏi ít nghi thức hơn — đã được xác nhận, nhưng với một điểm nhấn: chúng cũng có thể kháng lại sự điều hướng rõ ràng hơn.
Đối với các kỹ sư xây dựng harness agent, điều này có nghĩa là mẫu supervisor cần phải tiến hóa. Dựa vào mô hình để tự bộc lộ các giả định của nó là một canh bạc thua. Thay vào đó, bạn cần trích xuất quyết định rõ ràng và các vòng lặp xác thực bên ngoài.
Các mô hình tốt hơn đang đòi hỏi ít nghi thức hơn để hoạt động hiệu quả — nhưng chúng cũng có thể trở nên khó kiểm soát hơn.
| Cấu hình | Điểm |
|---|---|
| GPT-5.5 (công bố) | 83,8% |
| chum-codex + GPT-5.5 | 89,9% |
| Vanilla Codex + GPT-5.5 (chạy lại) | 88,8% |
| GPT-5.6 Sol (OpenAI công bố) | 88,8% |
| GPT-5.6 Sol Ultra (OpenAI công bố) | 91,9% |
| chum-codex + GPT-5.6 Sol (tốt nhất) | 94% |
Thảo luận
0 bình luận
Hãy là người đầu tiên thảo luận.