Pulpie: Trình trích xuất nội dung HTML rẻ hơn 20 lần, đạt chất lượng SOTA
Feyn Labs phát hành mã nguồn mở Pulpie, một họ mô hình dựa trên encoder giúp trích xuất nội dung chính từ HTML với chi phí chỉ bằng một phần nhỏ so với các phương pháp hiện có, đạt chất lượng ngang Dripper nhưng nhanh hơn 20 lần.

Feyn Labs đã phát hành Pulpie, một họ mô hình Pareto-tối ưu để trích xuất nội dung chính từ các trang HTML. Mô hình nhỏ nhất, pulpie-orange-small (210M tham số), đạt 0,862 ROUGE-5 F1 trên WebMainBench — gần như giống hệt 0,864 của Dripper — nhưng chi phí vận hành chỉ bằng một phần hai mươi. Trên GPU NVIDIA L4, nó xử lý 13,7 trang mỗi giây so với 0,68 của Dripper. Làm sạch 1 tỷ trang sẽ tốn 7.900 đô la với Pulpie so với 159.000 đô la với Dripper.
Hiểu biết kiến trúc chính: Pulpie sử dụng một encoder gắn nhãn mọi khối HTML là nội dung hoặc boilerplate trong một lượt chuyển tiếp duy nhất, trong khi Dripper là một decoder phát ra nhãn từng token một, khiến tốc độ bị ràng buộc bởi băng thông bộ nhớ. Điều này làm cho Pulpie nhỏ hơn, nhanh hơn và rẻ hơn trong khi vẫn duy trì chất lượng.
Đường ống của Pulpie chạy qua bốn giai đoạn: đơn giản hóa HTML (loại bỏ script, style), chia các khối thành các đoạn 8.192 token, phân loại từng khối qua một lượt chuyển tiếp, và trả về các khối được giữ lại dưới dạng HTML hoặc Markdown. Khoảng 80% trang vừa vặn trong một đoạn duy nhất.
Việc huấn luyện yêu cầu xây dựng một bộ dữ liệu có nhãn từ đầu. Nhóm đã lấy mẫu 16.670 trang tiếng Anh từ Common Crawl, gắn nhãn các khối bằng DeepSeek V3.2, sau đó kiểm tra chéo với Dripper 0.6B, giữ lại 14.959 trang có độ đồng thuận giữa các người gắn nhãn ≥70%. Một mô hình giáo viên (EuroBERT-2.1B) được tinh chỉnh trên dữ liệu này, đạt 0,873 ROUGE-5 F1. Mô hình giáo viên đó sau đó được chưng cất thành hai encoder nhỏ hơn: Pulpie Orange Base (610M) và Pulpie Orange Small (210M), sử dụng mất mát KL-divergence với trọng số 0,7 và cross-entropy nhãn cứng ở 0,3.
Các mô hình chưng cất giữ lại gần như toàn bộ chất lượng của giáo viên. Mô hình 210M nằm trong khoảng 1,1 điểm F1 so với giáo viên 2,1B, và nó ngang bằng Dripper với kích thước chỉ bằng một phần ba. Dripper cũng thất bại trên 135 trang trong benchmark (chủ yếu do tràn cửa sổ ngữ cảnh), trong khi Pulpie xử lý các trang có độ dài tùy ý bằng cách chia thành các đoạn.
Chất lượng dữ liệu rất quan trọng. Bài viết trích dẫn nghiên cứu AICC cho thấy việc trích xuất sạch hơn từ Common Crawl đã cải thiện độ chính xác benchmark lên 1,08 điểm phần trăm, vượt qua các kho ngữ liệu được lọc mạnh như FineWeb và RefinedWeb. Khi suy luận, một đoạn văn không liên quan duy nhất có thể làm hỏng câu trả lời của mô hình — vì vậy ngữ cảnh sạch là rất quan trọng cho cả huấn luyện và sản xuất.
Pulpie là mã nguồn mở và có sẵn trên Hugging Face. Đối với bất kỳ ai thực hiện trích xuất web quy mô lớn — dù cho đường ống dữ liệu tiền huấn luyện hay quản lý ngữ cảnh RAG — đây là một bước tiến đáng kể về chi phí và thông lượng.
Nguồn: Feyn
Thảo luận
0 bình luận
Hãy là người đầu tiên thảo luận.