Codex của Cloudflare: Cách các tác nhân AI thực thi tiêu chuẩn kỹ thuật ở quy mô lớn
Trình đánh giá mã AI của Cloudflare đã gắn cờ gần 230.000 vi phạm tiêu chuẩn và chặn 16.000 lượt hợp nhất. Đằng sau nó là Codex, một bộ tiêu chuẩn kỹ thuật được quản trị mà các tác nhân truy xuất và áp dụng tại điểm làm việc.

Cloudflare đã chạy một thử nghiệm nội bộ về tiêu chuẩn kỹ thuật được thực thi bằng AI, và những con số thật khó để bỏ qua. Trong bốn tháng qua, trình đánh giá mã AI của họ đã gắn cờ gần một phần tư triệu sai lệch so với tiêu chuẩn công ty và chặn 16.000 lượt hợp nhất. Một trình đánh giá đặc tả riêng đã đánh giá gần 600 thiết kế kỹ thuật trước khi triển khai. Cả hai hệ thống đều lấy từ Cloudflare Codex, một nguồn hướng dẫn kỹ thuật dùng chung được xây dựng cho cả con người và tác nhân.
Trước Codex, hướng dẫn dành cho nhà phát triển tại Cloudflare nằm rải rác ở nhiều nơi: tài liệu chính thức, tệp kho lưu trữ, chuỗi trò chuyện và trong đầu các kỹ sư cấp cao. Việc tìm đúng tiêu chuẩn thường đòi hỏi phải lục lọi qua các wiki lỗi thời hoặc hỏi người có thể biết. Khi công ty phát triển, mô hình đó sụp đổ. Không ai có thể đọc mọi tiêu chuẩn, và người đánh giá không thể kiểm tra đáng tin cậy mọi yêu cầu.
Codex: Một quy trình RFC được quản trị
Codex được tổ chức thành các lĩnh vực—kiến trúc, bảo mật, độ tin cậy, các ngôn ngữ cụ thể như TypeScript và Rust—mỗi lĩnh vực có một chủ sở hữu chịu trách nhiệm về chất lượng nội dung. Các tiêu chuẩn được viết dưới dạng RFC sử dụng từ khóa SHOULD và MUST của RFC 2119. Bất kỳ nhân viên nào cũng có thể đề xuất RFC qua yêu cầu hợp nhất; nó trải qua các vòng phản hồi trước khi được chủ sở hữu lĩnh vực phê duyệt. Các RFC được phê duyệt trở thành một phần của Codex và được xuất bản lên một trang web nội bộ chạy bằng Astro.
Nhưng phê duyệt không phải là thực thi. Một RFC phải được nâng cấp rõ ràng từ được phê duyệt lên được thực thi trước khi các yêu cầu MUST của nó có thể chặn các lượt hợp nhất. Quy trình hai giai đoạn này cho các nhóm thời gian để tiếp thu các yêu cầu mới và xử lý các trường hợp cần thêm công sức thực thi.
Nuôi LLM mà không làm vỡ cửa sổ ngữ cảnh
Với hơn 60 RFC và đang tăng, việc đưa toàn bộ Codex vào một LLM sẽ gây áp lực lên cửa sổ ngữ cảnh và làm giảm chất lượng kết quả. Vì vậy, Cloudflare đã xây dựng một tác nhân trích xuất và nén các câu SHOULD và MUST thành định dạng JSON có cấu trúc, được làm giàu bằng siêu dữ liệu để khám phá lười biếng và tiết lộ dần dần. Mỗi câu có một định danh slug ổn định tồn tại qua các bản cập nhật RFC, cho phép theo dõi trên các hệ thống.
Định dạng JSON bao gồm số RFC, lĩnh vực, cấp độ câu và liên kết trở lại phần RFC đầy đủ. Điều này cho phép các tác nhân lọc chính xác mà không cần tải toàn bộ tài liệu.
Ba tác nhân, một Codex
Trình đánh giá mã AI đánh giá các yêu cầu hợp nhất về mức tuân thủ Codex. Nó truy xuất các RFC liên quan, phân tích các câu và quyết định dựa trên SHOULD so với MUST và trạng thái RFC. Kể từ khi ra mắt, nó đã gắn cờ ~230.000 vi phạm, với ~16.000 khiến việc phê duyệt bị giữ lại.
Để giải quyết các khiếu nại về độ trễ, Cloudflare đã thêm hai lựa chọn thay thế: các gói cấu hình linter tùy chỉnh cho các yêu cầu cụ thể theo ngôn ngữ (TypeScript trước, Rust đang phát triển, Go sau) giúp phát hiện vấn đề trong mili giây, và một CLI chạy cùng các tác nhân dựa trên OpenCode cục bộ, cắt bỏ vòng lặp CI.
Trình đánh giá đặc tả đánh giá các tài liệu thiết kế trước khi triển khai. Nó chạy như một Cloudflare Worker, lưu trạng thái trong D1, định tuyến các yêu cầu mô hình qua AI Gateway và quét các đặc tả mới qua Cron Trigger. Kể từ tháng 5 năm 2026, nó đã đánh giá ~600 đặc tả duy nhất qua hơn 3.200 lần gọi. Các phát hiện được xếp hạng theo mức độ nghiêm trọng: 65% lớn, 29% nhỏ, 6% nghiêm trọng.
Trình đánh giá báo cáo sự cố áp dụng cùng mô hình cho các bài đánh giá sau sự cố, kiểm tra tính đầy đủ và chất lượng của các giải thích sự cố, yếu tố góp phần, giải pháp và hành động tiếp theo.
Bài học rút ra
Codex của Cloudflare là một nỗ lực nghiêm túc để làm cho các tiêu chuẩn kỹ thuật có thể thực thi—không chỉ được ghi chép. Hiểu biết chính là sự tách biệt giữa phê duyệt và thực thi, và việc trích xuất có cấu trúc giữ cho cửa sổ ngữ cảnh LLM ở mức hợp lý. Cách tiếp cận linter cho các kiểm tra cơ học là thực dụng; tùy chọn CLI tôn trọng sở thích của kỹ sư. Đây là một bản thiết kế mà các tổ chức lớn khác có thể sẽ học theo.
Hiểu biết chính là sự tách biệt giữa phê duyệt và thực thi—và việc trích xuất có cấu trúc giữ cho cửa sổ ngữ cảnh LLM ở mức hợp lý.