Matryoshka so với PCA: Thủ thuật cổ điển đánh bại việc cắt ngắn MRL
Một điểm chuẩn đối đầu cho thấy PCA có thể thu nhỏ embeddings hơn nữa so với cắt ngắn Matryoshka trong khi vẫn giữ được nhiều chất lượng truy xuất hơn — và nó hoạt động trên mọi mô hình, không chỉ các mô hình được huấn luyện MRL.

Cơ sở dữ liệu vector là câu trả lời mặc định để lưu trữ và tìm kiếm embeddings của LLM, nhưng khi bộ sưu tập phát triển, chi phí và độ trễ của vector nhiều chiều sẽ tăng lên. Các phòng thí nghiệm AI đã đẩy Matryoshka Representation Learning (MRL) như một giải pháp: huấn luyện mô hình sao cho vài chiều đầu tiên mang tín hiệu nhiều nhất, sau đó cắt ngắn tại thời điểm suy luận. Nó hoạt động — nhưng chỉ trên các mô hình được huấn luyện cho mục đích đó, và chất lượng giảm mạnh ở các chiều rất nhỏ.
Dylan Castillo đã chạy một điểm chuẩn đối đầu giữa cắt ngắn MRL với một kỹ thuật cũ hơn nhiều: Principal Component Analysis (PCA). Kết quả là một lời nhắc nhở rằng đôi khi công cụ nhàm chán, trước thời kỳ học sâu mới là công cụ đúng đắn.
Thí nghiệm
Castillo đã lấy hai mô hình được huấn luyện MRL — text-embedding-3-small của OpenAI (1.536 chiều) và qwen3-embedding-8b của Alibaba (4.096 chiều) — và giảm embeddings của chúng xuống 512, 256, 128, 64 và 32 chiều bằng cả cắt ngắn và PCA. Anh ấy đánh giá chất lượng truy xuất (NDCG@10) trên tám bộ dữ liệu BEIR. Anh ấy cũng thêm text-embedding-ada-002, một mô hình không phải MRL, làm đối chứng để xem hiệu suất của PCA có phụ thuộc vào huấn luyện MRL hay không.
PCA thắng ở các chiều nhỏ
Ở 512 chiều, cắt ngắn giữ lợi thế nhẹ. Nhưng khi các chiều thu nhỏ, PCA bắt kịp rồi vượt lên. Trên text-embedding-3-small, PCA giữ được 65% chất lượng ở 32 chiều so với 46% của cắt ngắn. Trên qwen3-embedding-8b, khoảng cách nhỏ hơn (71% so với 68%) nhưng vẫn nghiêng về PCA. Trên các bộ dữ liệu, PCA thắng trên bảy trong tám cho 3-small và sáu trong tám cho qwen3 ở các kích thước nhỏ nhất.
Thí nghiệm đối chứng đã trả lời câu hỏi thứ hai: PCA hoạt động tốt như nhau trên ada-002, mô hình chưa từng được huấn luyện MRL. Vì vậy, lợi thế không phải là sản phẩm phụ của không gian embedding có tổ chức của MRL — PCA là một công cụ thu nhỏ đa năng.
Điểm trừ: độ phức tạp vận hành
PCA không miễn phí. Bạn phải khớp một ma trận chiếu trên một mẫu embeddings của mình, lưu trữ và quản lý phiên bản, và áp dụng cùng một phiên bản một cách nhất quán khi lập chỉ mục và truy vấn. PCA ngoài miền — khớp trên MS MARCO và tái sử dụng ở mọi nơi — làm giảm chất lượng, vì vậy bạn có thể cần khớp theo từng kho ngữ liệu. Đó là chi phí thực sự, nhưng đối với một chỉ mục lớn, nó có thể đáng giá.
PCA đạt hoặc vượt cắt ngắn MRL ở gần như mọi chiều trên cả hai mô hình được huấn luyện MRL.
Toàn bộ mã và dữ liệu có trên GitHub, vì vậy bạn có thể tái tạo các con số và tự quyết định.
PCA đạt hoặc vượt cắt ngắn MRL ở gần như mọi chiều trên cả hai mô hình được huấn luyện MRL.
| Chiều | 3-small Cắt ngắn | 3-small PCA | qwen3-8b Cắt ngắn | qwen3-8b PCA |
|---|---|---|---|---|
| 512 | 98% | 97% | 99% | 98% |
| 256 | 94% | 95% | 96% | 96% |
| 128 | 86% | 90% | 91% | 91% |
| 64 | 71% | 82% | 83% | 84% |
| 32 | 46% | 65% | 68% | 71% |
Thảo luận
0 bình luận
Hãy là người đầu tiên thảo luận.