lumabri: Chạy Mô Hình MoE Khổng Lồ Trên Một Bầy Máy Ngang Hàng, Thuần C
lumabri cho phép bất kỳ máy nào — dù có GPU hay không — phục vụ và trò chuyện với các mô hình mixture-of-experts khổng lồ bằng cách truyền phát byte và định tuyến kích hoạt chuyên gia qua các máy ngang hàng, với xác minh danh tính byte nghiêm ngặt và không cần FUSE.

lumabri là một dự án mã nguồn mở mới biến một bầy máy thông thường thành một cụm suy luận phân tán cho các mô hình mixture-of-experts (MoE) khổng lồ. Được xây dựng trên engine colibri và viết bằng C thuần không phụ thuộc thư viện, nó cho phép một máy chia sẻ mô hình trong khi bất kỳ máy nào khác trò chuyện với nó — không cần tải trước, không cần GPU.
Mẹo cốt lõi là một shim LD_PRELOAD (liblumabri.so) chặn các lời gọi libc như open, pread và opendir. Các tệp xuất hiện như các bản sao cục bộ thưa thớt với kích thước thật, vì vậy các thao tác tệp bình thường của engine vẫn hoạt động. Các khối bị thiếu được lấy từ các máy ngang hàng khi sử dụng lần đầu và được lưu vào bộ nhớ cache cục bộ, do đó các lần đọc sau chạm vào đĩa cục bộ với tốc độ tối đa. Không FUSE, không daemon trên đường đọc.
Đối với các mô hình MoE, chatter chỉ giữ các trọng số dày đặc, router và KV cache. Kích hoạt 4 KB cho mỗi chuyên gia được định tuyến được gửi đến máy ngang hàng giữ các trọng số chuyên gia đó. Trọng số chuyên gia không bao giờ đến chatter. Cả hai phía được xây dựng từ cùng một mã nguồn engine, vì vậy các lần chạy cục bộ và phân tán tạo ra các token giống hệt nhau từng byte.
Niềm tin được xử lý cẩn thận. Mỗi maintainer tính sha256 cho mỗi MiB và gửi nó cùng với đăng ký. Nguồn gốc ký sự thật đó bằng khóa ed25519 ngoại tuyến. Một chatter xác minh mọi khối dựa trên khóa mà chính nó giữ. Đối với tính toán từ xa, LUMABRI_VERIFY=N chạy lại N phần trăm các lời gọi chuyên gia trên một bản sao thứ hai và yêu cầu đầu ra giống hệt nhau. Bất đồng sẽ dừng quá trình chạy.
Các engine được hỗ trợ bao gồm OLMoE, GLM, Inkling, Kimi K3 và DeepSeek V4, mỗi engine có một nút chuyên gia riêng. Dự án tuyên bố các token giống hệt nhau từng bit giữa các lần chạy cục bộ và phân tán, được chứng minh bằng một bài kiểm tra đã bắt được một lỗi thực sự trong xử lý chuyên gia của GLM.
Triển khai đơn giản: make, sau đó lumabri serve --model /path/to/model trên máy chủ, và lumabri chat --tracker <server-ip>:7300 --engines-dir /path/to/colibri/c trên máy khách. Các nhà tài trợ đĩa và tính toán tham gia bằng các lệnh đơn giản. Mã hóa tùy chọn qua X25519/Ed25519 và ChaCha20-Poly1305 có sẵn.
Các mạng gộp GPU tuyển dụng từ số ít. lumabri tuyển dụng từ tất cả mọi người.
| Engine | Mô hình | Trò chuyện | Nút chuyên gia |
|---|---|---|---|
| olmoe | OLMoE | có | expert_node |
| colibri | GLM | có | expert_node_glm |
| inkling | Inkling | có | expert_node_inkling |
| kimi_k3 | Kimi K3 | có | expert_node_kimi |
| deepseek | DeepSeek V4 | có | expert_node_deepseek |
Thảo luận
0 bình luận
Hãy là người đầu tiên thảo luận.