LM Studio đưa GLM-5.3-Flash lên Bionic, hỗ trợ hình ảnh và Context 1 triệu Token

Bởi
KOMCHAD
BởiKOMCHAD
KOMCHAD cập nhật tin tức mới nhất về IT, AI, điện thoại thông minh, thiết bị, máy tính, an ninh mạng và đổi mới.

LM Studio nhanh chóng đưa GLM-5.3-Flash lên Bionic

LM Studio đã bổ sung GLM-5.3-Flash mới của Z.ai vào Bionic. Nền tảng AI Agent nhờ đó có thêm một Model có thể xử lý cả văn bản lẫn hình ảnh, hỗ trợ Context Window lên tới 1 triệu Token và có chi phí sử dụng Cloud thấp hơn đáng kể so với GLM-5.2.

Bionic là nền tảng của LM Studio dành cho các công việc Agentic trên Mac và Windows. Kể từ khi được công bố lần đầu vào giữa tháng 7, LM Studio liên tục bổ sung Model và tính năng phục vụ Coding, Research cũng như xử lý Documents và Files. Người dùng có thể chọn Model chạy Local ngay trên máy của mình hoặc Model được cung cấp qua Cloud.

GLM-5.3-Flash được đưa vào Bionic chỉ vài giờ sau khi Z.ai chính thức công bố Model. Trước khi phát hành công khai, Model này đã thu hút sự chú ý trong các thử nghiệm ẩn danh trên OpenCode và OpenRouter với Codename “Ox Alpha”.

Kiến trúc Mixture-of-Experts 320B nhưng chỉ 18B Active Parameters

GLM-5.3-Flash được xây dựng theo kiến trúc Mixture-of-Experts với tổng cộng 320 tỷ Parameters, nhưng chỉ 18 tỷ Parameters ở trạng thái Active trong quá trình Inference. Đây là điểm quan trọng của kiến trúc MoE: Model có thể có quy mô tổng thể rất lớn nhưng chỉ kích hoạt phần cần thiết cho từng Request.

Theo các thông số được nhấn mạnh trong công bố, Model hỗ trợ cả Text và Image Input. Vì vậy, việc tích hợp vào Bionic không chỉ giới hạn ở văn bản mà còn phù hợp với những Workflow trong đó Agent cần hiểu thông tin hình ảnh cùng với hướng dẫn bằng chữ hoặc Documents.

Model cũng hỗ trợ Context Window lên tới 1 triệu Token. Dung lượng này cho phép giữ nhiều nội dung hơn đáng kể trong cùng một Session so với các Model có Context ngắn, đặc biệt hữu ích cho Research, Codebase lớn và Agent Workflow phải xử lý nhiều Documents.

Image Input mở rộng loại dữ liệu mà Bionic Agent có thể xử lý

Hỗ trợ Image Input là một trong những bổ sung thực tế nhất của GLM-5.3-Flash. Bionic được thiết kế cho Agentic Tasks chứ không chỉ là một Chatbot hỏi đáp đơn giản, vì vậy Multimodal Input cung cấp thêm một loại thông tin để Agent phân tích trong quá trình hoàn thành công việc.

Chẳng hạn, một Workflow có thể kết hợp hướng dẫn bằng văn bản với Screenshot, Diagram hoặc các Visual Material khác. Nguồn tin không khẳng định Model hỗ trợ mọi loại tác vụ hình ảnh có thể có, nhưng việc bổ sung Image Input rõ ràng mở rộng phạm vi thông tin mà Model có thể tiếp nhận so với một Setup Text-only.

Khả năng này kết hợp với định hướng sẵn có của Bionic dành cho Coding, Research, Documents và Files, mang lại thêm lựa chọn Model cho những công việc cần cả Text Context lẫn Visual Input.

Context 1 triệu Token hướng đến khối lượng công việc lớn và phức tạp

Context Window 1 triệu Token là một điểm quan trọng khác của GLM-5.3-Flash. Context quyết định lượng thông tin mà Model có thể xem xét trong một Request hoặc Session, vì vậy Window lớn hơn đặc biệt hữu ích khi Agent cần theo dõi một lượng tài liệu rất lớn.

Trong thực tế, điều này có thể hữu ích khi xử lý Documents dài, nhiều Files, lượng lớn tài liệu Research hoặc các phần rộng của một Codebase. Context lớn không tự động đảm bảo câu trả lời tốt hơn, nhưng cho phép đưa vào nhiều Source Material hơn mà không phải chia nhỏ mọi thứ ngay từ đầu.

Đối với Bionic, vốn được định vị là Agent Platform cho công việc nhiều bước, dung lượng này đặc biệt phù hợp vì Agentic Workflow thường phải giữ lại thông tin từ các bước trước để tiếp tục sử dụng ở những bước sau.

LM Studio cho biết chi phí thấp hơn GLM-5.2 khoảng 9–10 lần

Chi phí là một phần quan trọng khác của công bố. LM Studio cho biết GLM-5.3-Flash có thể rẻ hơn khoảng 9 đến 10 lần khi vận hành so với GLM-5.2, đồng thời vượt GLM-5.2 trong các so sánh Performance được Z.ai nhấn mạnh.

Lợi thế về giá có ý nghĩa lớn với Agentic Workflow vì một Agent có thể gọi Model nhiều lần trong quá trình Research, đọc Files, viết Code hoặc hoàn thành một Task nhiều giai đoạn. Khi số lượng Model Calls tăng, Inference Cost thấp hơn có thể tạo ra khác biệt đáng kể về tổng chi phí.

Vì vậy, LM Studio nhấn mạnh sự kết hợp giữa Performance, Multimodal Input, Long Context và chi phí thấp hơn là lý do chính khiến GLM-5.3-Flash trở thành một bổ sung đáng chú ý cho Bionic, thay vì chỉ là một Model mới trong danh mục.

Cloud Inference dùng Server tại Mỹ với Zero Data Retention

Bionic hỗ trợ cả Model chạy Local và Cloud Model. Với GLM-5.3-Flash trong Bionic, LM Studio cho biết Model được phục vụ từ các Server đặt tại Mỹ và Zero Data Retention được bật mặc định.

Điều này khác với việc chạy Model hoàn toàn trên máy tính Local, nơi Inference có thể được giữ trên Hardware của người dùng. Khi chọn Cloud Model, Workload được gửi tới Remote Infrastructure, vì vậy chính sách Zero Data Retention mà LM Studio công bố là một phần quan trọng trong cách hãng mô tả lựa chọn Cloud.

Sự khác biệt này cũng phản ánh cách tiếp cận rộng hơn của Bionic: người dùng không bị giới hạn vào một kiểu Deployment duy nhất mà có thể chọn Local hoặc Cloud Inference tùy theo Model, yêu cầu Hardware và Workflow.

GLM-5.3-Flash gia nhập danh sách Model Bionic đang mở rộng nhanh chóng

LM Studio đã mở rộng Bionic với tốc độ nhanh kể từ khi công bố nền tảng vào giữa tháng 7. Không lâu sau khi Bionic ra mắt, công ty bổ sung hỗ trợ Kimi K3 của Moonshot AI, và giờ GLM-5.3-Flash trở thành một Cloud Model khác dành cho công việc Agentic.

Theo các so sánh Benchmark được 9to5Mac dẫn lại, GLM-5.3-Flash đạt điểm cao hơn GLM-5.2 trong những bài kiểm tra mà Z.ai nhấn mạnh và nhìn chung nằm trong vùng tương tự các Frontier Models của Anthropic, OpenAI, Google và DeepSeek. Benchmark không có nghĩa các Model khác nhau có thể thay thế lẫn nhau trong mọi Task, nhưng giúp lý giải vì sao GLM-5.3-Flash đã thu hút sự chú ý trước cả khi chính thức phát hành.

Với người dùng LM Studio, ý nghĩa trực tiếp hơn nằm ở tổ hợp hiện có trong Bionic: Text và Image Input, Context Window 1 triệu Token, kiến trúc Mixture-of-Experts quy mô lớn và chi phí Cloud mà LM Studio cho biết thấp hơn đáng kể so với GLM-5.2.

Chia sẻ bài viết này
BởiKOMCHAD
Theo dõi:
KOMCHAD cập nhật tin tức mới nhất về IT, AI, điện thoại thông minh, thiết bị, máy tính, an ninh mạng và đổi mới.
Để lại bình luận