Tin tức

Dây cương tác nhân của GitHub Copilot: Cùng mô hình, ít token hơn

Dây cương tác nhân của GitHub đạt tỷ lệ hoàn thành nhiệm vụ tương đương các công cụ từ nhà cung cấp mô hình trong khi tiêu thụ ít token hơn và hỗ trợ hơn 20 mô hình. Lợi ích thực sự là sự lựa chọn không bị khóa.

July 3, 2026· 2 min read· Nguồn: The GitHub Blog
Dây cương tác nhân của GitHub Copilot: Cùng mô hình, ít token hơn

GitHub đã công bố kết quả điểm chuẩn so sánh dây cương tác nhân Copilot của mình với các dây cương gốc từ mô hình như Claude Code và Codex CLI. Điểm nhấn: cùng mô hình, cùng nhiệm vụ, nhưng ít token bị đốt hơn—mà không hy sinh tỷ lệ giải quyết.

Dây cương là nền tảng thời gian chạy dùng chung đằng sau Copilot CLI, ứng dụng Copilot và đánh giá mã Copilot. Cải thiện nó một lần, mọi bề mặt đều được hưởng lợi. GitHub đã chạy năm điểm chuẩn—SWE-bench Verified, SWE-bench Pro, SkillsBench, TerminalBench và một điểm chuẩn container Windows nội bộ—trên Claude Sonnet 4.6, Claude Opus 4.7, GPT-5.4 và GPT-5.5.

Hiệu quả token là điểm nổi bật. Trong hầu hết các cấu hình, dây cương của GitHub sử dụng ít token hơn dây cương của chính nhà cung cấp mô hình trong khi đạt tỷ lệ hoàn thành nhiệm vụ tương đương. Sự khác biệt về tỷ lệ giải quyết nằm trong nhiễu ngẫu nhiên—thực chất là ngang bằng.

GitHub cũng công bố biểu đồ phân tán chi phí so với tỷ lệ giải quyết cho TerminalBench 2.0. Các điểm đánh dấu của dây cương Copilot nằm trong cùng góc phần tư hoặc tốt hơn (lên trên và sang trái) so với các đối thủ cùng mô hình. Các mô hình GPT mang lại giá trị tốt nhất; Claude Opus đạt tỷ lệ giải quyết cao nhất với mức phí cao. Dây cương cho phép bạn chọn một trong hai, hoặc để lựa chọn mô hình tự động quyết định.

Câu chuyện đa mô hình là điểm khác biệt thực sự. Dây cương hỗ trợ hơn 20 mô hình thuộc các họ GPT, Claude, Gemini và MAI, cùng với tùy chọn mang khóa riêng cho các mô hình mã nguồn mở hoặc cục bộ. Một dây cương từ nhà cung cấp mô hình không thể làm được điều đó. Nó cũng cho phép các tính năng phê bình chéo mô hình như Rubber Duck, nơi một mô hình đánh giá đầu ra của mô hình khác.

Đây là một cách tiếp cận thực dụng: đừng đặt cược tất cả vào một mô hình, đừng lãng phí token và đừng hy sinh kết quả. Điểm chuẩn chỉ là một tín hiệu, nhưng hướng đi đã rõ ràng.