Meta phát hành Muse Glimmer, mô hình AI Open-Weight 30B được thiết kế để chạy cục bộ
Meta đã phát hành Muse Glimmer, một mô hình trí tuệ nhân tạo open-weight mới với 30 tỷ tham số, được thiết kế để chạy các khối lượng công việc tác nhân ngay trên máy tính cá nhân và workstation thay vì phải đưa mọi tác vụ lên đám mây.
Điểm đáng chú ý của lần phát hành này là Meta kết hợp kiến trúc dense tương đối gọn với trọng số mở, ngữ cảnh dài và khả năng dành cho tác nhân. Nhà phát triển có thể xây dựng hệ thống suy luận nhiều bước, gọi công cụ, xử lý thông tin đa phương thức và tiếp tục workflow trong khi giữ nhiều hoạt động xử lý hơn trên phần cứng cục bộ.
Muse Glimmer hướng tới AI agent cục bộ luôn hoạt động
Muse Glimmer là mô hình dense 30 tỷ tham số từ Meta Superintelligence Labs, được tạo cho workload tác nhân có thể duy trì hoạt động trên máy của người dùng. Meta định vị mô hình cho suy luận nhiều bước, lập trình, sử dụng công cụ, hiểu đa phương thức và phục hồi khi workflow thất bại, thay vì chỉ hỏi đáp ngắn.
Mô hình 30B được thiết kế chạy trên một GPU
Mô hình được thiết kế để chạy cục bộ trên một GPU đủ mạnh, đưa các workload AI vốn thường phụ thuộc hạ tầng đám mây đến gần PC và workstation hơn. Meta cung cấp trọng số theo giấy phép Apache 2.0, cho phép sử dụng, chỉnh sửa và phân phối lại, kể cả cho dự án thương mại, theo điều khoản giấy phép.
Được distill từ Muse Spark với ngữ cảnh dài
Muse Glimmer được distill từ mô hình Muse Spark lớn hơn của Meta. Tài liệu của Meta và hệ sinh thái mô tả cửa sổ ngữ cảnh hơn 120.000 tokens cùng thành phần perception chuyên dụng cho đầu vào đa phương thức. Sự kết hợp này nhằm giúp agent duy trì lượng lớn working context trong chuỗi quyết định, gọi công cụ và xử lý kết quả kéo dài.
AMD và NVIDIA thúc đẩy triển khai cục bộ
AMD báo cáo thử nghiệm Windows sơ bộ đạt tối đa 24 tokens/s trên Ryzen AI Max+ 395 và tối đa 53 tokens/s trên Radeon AI PRO R9700 khi bật dFlash. NVIDIA cũng nhấn mạnh Muse Glimmer cho workflow tác nhân cục bộ. Hiệu năng thực tế thay đổi theo quantization, bộ nhớ, software stack và cấu hình phần cứng.
Vì sao AI open-weight cục bộ quan trọng
Chạy agent cục bộ có thể giảm chi phí token đám mây lặp lại và giữ nhiều dữ liệu làm việc hơn trên thiết bị. Điều này quan trọng với workflow liên quan đến file cục bộ, tin nhắn hoặc dữ liệu độc quyền, đồng thời cho nhà phát triển nhiều quyền kiểm soát hơn đối với inference, tùy biến và tích hợp. Tuy nhiên mô hình 30B vẫn cần nhiều bộ nhớ và phần cứng đủ mạnh, không có nghĩa nó sẽ chạy tốt như nhau trên mọi laptop phổ thông.
Meta đang chuẩn bị Muse Spark 1.2 open-weight
Việc phát hành Glimmer cũng cho thấy Meta đang thúc đẩy open-weight trở lại. Mark Zuckerberg cho biết công ty dự định sớm phát hành phiên bản open-weight của Muse Spark 1.2 mạnh hơn. Vì vậy Glimmer vừa là mô hình cục bộ thực tế có thể dùng ngay, vừa là dấu hiệu Meta muốn đưa nhiều hơn dòng Muse ra ngoài mô hình cloud đóng.







