GLM 팀은 z.ai의 블로그에 추론 인프라의 아키텍처와 설계에 대한 자세한 게시물을 게재했습니다.
- 이 기사는 GLM이 모델 서빙과 최적화를 어떻게 처리하는지에 대한 심층적인 기술 개요를 제공합니다.
- 대규모 언어 모델 배포 시스템에 관심 있는 사람들에게 «매우 흥미로운 읽을거리»로 소개되었습니다.
GLM 팀은 z.ai의 블로그에 추론 인프라의 아키텍처와 설계에 대한 자세한 게시물을 게재했습니다.
Z.ai는 활성 파라미터 18B를 가진 320B 파라미터 다중 모달 MoE 모델인 GLM-5.3-Flash를 출시했으며, 알리바바의 Qwen 팀은 활성 파라미터 6B를 가진 125B 모델인 Qwen3.8-Flash-Next를 출시했습니다. 독립적인 개발 과정이었음에도 불구하고 두 팀은 거의 동일한 아키텍처 구성을 채택했습니다.
8개 모델에 대한 연구 결과, 에이전트 메모리는 보편적인 기능이 아니라 특정 모델의 능력에 맞게 보정해야 하는 용량임을 밝혀냈습니다. ALTK-Evolve 프레임워크는 에이전트의 과거 궤적에서 가이드라인을 추출하고 가중치 업데이트 없이 추론 시 주입하며, 최적의 메모리 전략이 모델 계층 간에 크게 달라짐을 보여줍니다.
llama.cpp 프로젝트는 GLM_DSA (GLM-5.2) 모델 아키텍처를 위한 NextN/MTP 추측 디코딩 지원을 도입하는 빌드 b10174을 출시했습니다.
PIVOT(Proxy Indexing Via One full-prefix Traversal)은 DeepSeek Sparse Attention(DSA) 인덱서를 위한 학습 불필요한 드롭인 대체재로, 근처 쿼리 그룹 간에 하나의 접두사 스캔을 공유하여 계산 중복성을 줄입니다. PIVOT은 각 쿼리에 대해 개별적으로 모든 선행 토큰을 점수 매기는 대신, 그룹을 단일 프록시 쿼리로 집계하여 후보 집합을 얻고, 여기서 각 쿼리별로 상위 k개 토큰을 선택합니다.
한 사용자가 GLM-5.2 (753B MoE) 모델을 NVFP4 4비트 KV 캐시를 사용하여 Int4-Int8Mix로 양자화하고, 4대의 DGX Spark (GB10) 시스템에서 실행하여 Terminal-Bench 2.1에서 70.8%의 점수를 달성했습니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침