Tin tức

Cloudflare Agents: Agent Tracing Là Lớp Quan Sát Còn Thiếu

Cloudflare ra mắt agent tracing cho Workers, mang lại cho nhà phát triển khả năng quan sát các lệnh gọi mô hình, thực thi công cụ và mức sử dụng token trong các phiên agent.

August 4, 2026· 3 min read· Nguồn: The Cloudflare Blog
Cloudflare Agents: Agent Tracing Là Lớp Quan Sát Còn Thiếu

Cloudflare đã âm thầm lắp ráp các mảnh ghép cho AI agents trên nền tảng nhà phát triển của mình: truy cập mô hình qua AI Gateway, runtime bền bỉ qua Durable Objects, điều phối với Workflows, thực thi sandbox và R2 cho lưu trữ. Hôm nay, họ kết nối tất cả dưới một banner duy nhất — Cloudflare Agents — với tính năng cụ thể đầu tiên là agent tracing.

Agent tracing là lớp quan sát mà telemetry ứng dụng truyền thống bỏ sót. Một agent có thể trả về HTTP 200 và vẫn thất bại: nó chọn sai công cụ, truyền context cũ cho subagent, hoặc đốt token trong vòng lặp retry. Tracing Workers tiêu chuẩn đã đo lường các span hạ tầng — lệnh gọi fetch, đọc KV, truy vấn D1 — nhưng nó không hiển thị các thao tác agent gây ra chúng. Agent tracing lấp đầy khoảng trống đó bằng cách thêm các span cho lần gọi agent, lệnh gọi mô hình, thực thi công cụ, sự kiện phê duyệt và các lệnh gọi subagent được hỗ trợ, tất cả song song với dữ liệu Workers hiện có.

Dashboard hiện có chế độ xem Agents chuyên dụng liệt kê các agent được quan sát, trace, phiên và mức sử dụng token. Hai cách để đào sâu: phát lại phiên hoặc xem trace. Tab Messages tái tạo toàn bộ cuộc trò chuyện cho một lượt — hướng dẫn hệ thống, tin nhắn người dùng, suy nghĩ của mô hình, lệnh gọi công cụ với đối số và kết quả, phản hồi cuối cùng. Đây là phát lại dữ liệu đã ghi, không phải thực thi lại, vì vậy bạn có thể bắt lỗi đối số công cụ sai định dạng hoặc thấy lượt trước ảnh hưởng đến kết quả sau như thế nào. Ghi lại payload là tùy chọn; bạn có thể tắt khi có dữ liệu nhạy cảm.

Tab Traces hiển thị waterfall thực thi, kết nối các thao tác agent với hạ tầng Cloudflare. Trong ví dụ, agent Travel_Planner ủy quyền cho subagent itinerary_builder, subagent này gọi mô hình, chạy công cụ, truy cập D1 và ghi vào KV — tất cả hiển thị trong một chế độ xem duy nhất. Lần gọi cha mất 2,72 phút, subagent 1,83, lệnh gọi mô hình hiển thị thời lượng và mức sử dụng token, và thực thi công cụ được đo bằng mili giây. Đó là mức chi tiết giúp việc gỡ lỗi agent trở nên khả thi.

Thiết lập đơn giản: bật tracing trong wrangler.jsonc, sau đó sử dụng tích hợp theo harness cụ thể. Think và Flue phát telemetry qua tích hợp tracing của chúng; AI SDK được bọc bằng adapter wrapAISDK() của Cloudflare; harness tùy chỉnh sử dụng API span tùy chỉnh tuân theo quy ước ngữ nghĩa Generative AI của OpenTelemetry. Mục tiêu dài hạn là hỗ trợ trực tiếp OpenTelemetry API bên trong Workers, để bất kỳ toolkit tuân thủ nào cũng hoạt động mà không cần adapter riêng của Cloudflare.

Trace có thể được xuất sang bất kỳ nhà cung cấp tương thích OTLP nào, vì vậy telemetry của bạn không bị khóa. Và vì trace có cấu trúc, chúng đóng vai trò là vòng phản hồi cho đánh giá, phân tích và báo cáo mức sử dụng token — không chỉ thứ bạn kiểm tra khi có sự cố, mà còn là cách liên tục cải thiện chất lượng, hiệu suất và chi phí của agent.

Một agent có thể trả về HTTP 200 và vẫn thất bại. Nó có thể chọn sai công cụ, truyền context cũ cho subagent, hoặc tiêu tốn token trong vòng lặp retry.
Ban biên tập Manul X