LM Studio, Bionic에 GLM-5.3-Flash 추가…이미지와 100만 Token Context 지원

작성자
KOMCHAD
작성자KOMCHAD
KOMCHAD는 IT, AI, 스마트폰, 가젯, 컴퓨터, 사이버 보안 및 혁신의 최신 소식을 전합니다.

LM Studio, GLM-5.3-Flash를 빠르게 Bionic에 추가

LM Studio가 Z.ai가 새롭게 공개한 GLM-5.3-Flash를 Bionic에 추가했다. 이에 따라 AI Agent 플랫폼에서 Text와 Image를 모두 처리하고 최대 100만 Token Context Window를 지원하며 GLM-5.2보다 훨씬 낮은 Cloud 비용을 내세운 모델을 사용할 수 있게 됐다.

Bionic은 Mac과 Windows에서 Agentic 작업을 수행하기 위한 LM Studio의 플랫폼이다. 7월 중순 처음 발표된 이후 Coding, Research, Documents와 Files를 다루는 작업을 중심으로 지원 모델과 기능을 꾸준히 확대해 왔다. 사용자는 자신의 기기에서 구동하는 Local Model과 Cloud Model을 모두 선택할 수 있다.

GLM-5.3-Flash는 Z.ai가 공식 공개한 지 불과 몇 시간 만에 Bionic에 추가됐다. 정식 출시 전에는 “Ox Alpha”라는 Codename으로 OpenCode와 OpenRouter에서 익명 테스트가 진행되며 이미 상당한 관심을 받았다.

320B MoE 모델이지만 Active Parameters는 18B

GLM-5.3-Flash는 전체 320B Parameters 규모의 Mixture-of-Experts 모델이지만 Inference 과정에서 실제 Active 상태가 되는 Parameters는 18B다. MoE 구조는 매우 큰 전체 모델을 구성하면서도 각 요청에 필요한 일부만 활성화할 수 있다는 점이 특징이다.

공개된 사양에 따르면 이 모델은 Text와 Image Input을 모두 지원한다. 따라서 Bionic에서도 Text-only 작업을 넘어 Agent가 시각 정보와 문서 또는 지시 사항을 함께 해석해야 하는 Workflow에 활용할 수 있다.

또한 최대 100만 Token Context Window를 지원한다. 짧은 Context를 가진 모델보다 한 번의 작업 Session에서 훨씬 많은 자료를 담을 수 있어 Research, 대규모 Codebase, 많은 문서를 처리하는 Agent Workflow에서 특히 중요한 사양이다.

Image Input으로 Bionic Agent가 다룰 수 있는 정보 확대

Image Input은 GLM-5.3-Flash의 실용적인 변화 가운데 하나다. Bionic은 단순한 질의응답 Chatbot보다 Agentic Task에 초점을 맞추고 있기 때문에 Multimodal Input은 Agent가 작업 중 확인할 수 있는 정보 유형을 늘려준다.

예를 들어 하나의 Workflow에 Text 지시 사항과 Screenshot, Diagram 또는 다른 Visual Material을 함께 넣을 수 있다. 원문은 모든 종류의 시각 작업을 지원한다고 주장하지 않지만 Image Input 추가로 Text-only 구성보다 입력 가능한 정보의 범위가 넓어진 것은 분명하다.

이 기능은 Bionic이 기존에 강조해 온 Coding, Research, Documents, Files 작업과 결합돼 Text Context와 Visual Input을 동시에 필요로 하는 작업에서 새로운 모델 선택지를 제공한다.

100만 Token Context는 크고 복잡한 작업을 겨냥

100만 Token Context Window 역시 GLM-5.3-Flash의 핵심 요소다. Context는 하나의 Request나 작업 Session에서 모델이 동시에 고려할 수 있는 정보량을 결정하기 때문에 큰 Window는 Agent가 방대한 자료를 추적해야 할 때 유용하다.

실제 사용에서는 긴 문서, 많은 파일, 대규모 Research 자료 또는 Codebase의 넓은 범위를 다룰 때 의미가 있다. Context가 크다고 답변 품질이 자동으로 좋아지는 것은 아니지만 Source Material을 처음부터 작은 단위로 계속 나누지 않고 더 많은 정보를 한 번에 제공할 수 있다.

여러 단계를 수행하는 Agent 플랫폼으로 자리 잡은 Bionic에서는 이런 용량이 특히 중요하다. Agentic Workflow는 이전 단계에서 얻은 정보를 이후 단계에서도 유지해야 하는 경우가 많기 때문이다.

LM Studio, GLM-5.2보다 9~10배 저렴하다고 설명

비용도 이번 발표의 핵심이다. LM Studio는 GLM-5.3-Flash가 GLM-5.2보다 9~10배 저렴하게 실행될 수 있으며 Z.ai가 공개한 Performance 비교에서도 GLM-5.2를 앞선다고 설명했다.

Agentic Workflow에서는 Research, 파일 읽기, Coding, 여러 단계의 작업을 진행하면서 모델을 반복 호출할 수 있다. 따라서 Model Calls가 많아질수록 낮은 Inference Cost가 전체 비용에 미치는 영향도 커진다.

LM Studio는 Performance, Multimodal Input, Long Context, 낮은 비용의 조합을 GLM-5.3-Flash가 Bionic에 의미 있는 추가가 되는 핵심으로 내세우고 있다.

Cloud Inference는 미국 Server 사용, Zero Data Retention 기본 적용

Bionic은 Local Model과 Cloud Model을 모두 지원한다. Bionic에서 GLM-5.3-Flash를 Cloud로 사용할 경우 LM Studio는 미국 기반 Server에서 서비스되며 Zero Data Retention이 기본으로 활성화된다고 밝혔다.

이는 모델을 사용자 컴퓨터에서 완전히 실행하는 Local Inference와 다르다. Local 환경에서는 Inference를 자신의 Hardware에 유지할 수 있지만 Cloud Model을 선택하면 작업이 Remote Infrastructure로 전달되므로 LM Studio가 설명하는 Zero Data Retention Policy가 Cloud 옵션에서 중요한 요소가 된다.

이 차이는 Bionic이 하나의 Deployment 방식만 강제하지 않는다는 점도 보여준다. 사용자는 모델, Hardware 요구 사항, Workflow에 따라 Local 또는 Cloud Inference를 선택할 수 있다.

빠르게 늘어나는 Bionic 모델 라인업에 새 선택지

LM Studio는 7월 중순 Bionic을 발표한 뒤 지원 모델을 빠르게 확대하고 있다. Bionic 출시 직후 Moonshot AI의 Kimi K3 지원을 추가했고, 이제 GLM-5.3-Flash도 Agentic 작업에 사용할 수 있는 Cloud Model에 합류했다.

9to5Mac이 소개한 Benchmark 비교에 따르면 GLM-5.3-Flash는 Z.ai가 강조한 테스트에서 GLM-5.2보다 높은 점수를 기록하며 Anthropic, OpenAI, Google, DeepSeek의 Frontier Models와 대체로 비슷한 범위에 위치한다. Benchmark만으로 서로 다른 모델을 동일하게 볼 수는 없지만 정식 공개 전부터 관심을 받은 이유를 설명하는 자료다.

LM Studio 사용자에게 더 직접적인 의미는 Bionic 안에서 Text와 Image Input, 100만 Token Context Window, 대규모 Mixture-of-Experts 구조, 그리고 LM Studio가 GLM-5.2보다 크게 낮다고 설명하는 Cloud 비용을 하나의 선택지로 사용할 수 있다는 점이다.

이 글 공유
작성자KOMCHAD
팔로우:
KOMCHAD는 IT, AI, 스마트폰, 가젯, 컴퓨터, 사이버 보안 및 혁신의 최신 소식을 전합니다.
댓글 남기기