Z.ai, 확장된 사후 학습이 적용된 GLM-5.3 출시
Z.ai는 베이스 모델인 GLM-5.2의 사후 학습을 확장하여 에이전트 코딩 벤치마크에서 최첨단 성능을 달성한 새로운 모델 GLM-5.3을 발표했습니다. 약 750B 파라미터를 가진 이 모델은 현재 Kimi K3을 능가하며 다양한 벤치마크에서 Claude Fable 5 및 GPT-5.6-Sol과 동등하거나 이를 초과하는 성능을 보입니다.
Z.ai는 베이스 모델인 GLM-5.2의 사후 학습을 확장하여 에이전트 코딩 벤치마크에서 최첨단 성능을 달성한 새로운 모델 GLM-5.3을 발표했습니다. 약 750B 파라미터를 가진 이 모델은 현재 Kimi K3을 능가하며 다양한 벤치마크에서 Claude Fable 5 및 GPT-5.6-Sol과 동등하거나 이를 초과하는 성능을 보입니다.
GLM 팀이 GLM 모델의 버전 5.3을 출시했습니다.
Z.ai는 743B 파라미터 모델의 업데이트인 GLM-5.3을 출시했으며, 이는 기본 모델 재학습이 아닌 확장된 사후 학습을 통해 성능 향상을 달성했다. 이번 릴리스는 현재 Z.ai API, GLM Coding Plan, ZCode를 통해 이용 가능하며, 공개 가중치는 안전성 평가 후 약 2주 후에 출시될 예정이다.
Mistral은 현재 플래그십 모델인 Mistral Medium 3.5보다 더 저렴한 가격으로 GLM-5.2 모델을 호스팅하고 있습니다.
저소득 및 중소득 환경을 위해 설계된 전용 검색 증강 생성(RAG) 시스템인 VITA가 HealthBench 벤치마크에서 범용 대규모 언어 모델에 대해 평가되었습니다. GPT-4.1 심판이 채점한 4,023개의 질문에 대해 VITA는 가능한 루브릭 포인트의 51.9%를 획득하여 1위를 차지했으며, GPT-5.4, o4-mini, Gemini 3.1 Pro 및 Claude Sonnet 4.6을 앞질렀습니다.
Macaron-V1은 실제 환경에서 학습하고 배포 후에도 학습을 계속할 수 있도록 설계된 경험적 지능용 오픈 에이전트 모델 패밀리입니다. 이 시스템은 두 가지 목표에 중점을 둡니다: 모델-하arness 쌍의 재귀적 개선을 통한 적응과, 사용자 턴마다 전문가 LoRA 어댑터를 선택하는 Mixture-of-LoRA (MoL) 아키텍처를 통한 협업.
Macaron-V1은 경험적 지능을 위해 설계된 오픈 에이전트 모델 패밀리로, 시스템이 실제 세계의 경험으로부터 학습하고 배포 후에도 지속적으로 개선할 수 있도록 합니다. 이 아키텍처는 두 가지 목표를 중심으로 합니다: 모델-하니스 쌍의 재귀적 자기 개선을 통한 적응과, 사용자 턴마다 전문가 어댑터를 선택하는 Mixture-of-LoRA(MoL) 시스템을 통한 협업.
Zhipu의 차기 모델 GLM-5.3에 대한 문서가 나타나 몇 초 만에 삭제되었습니다. 페이지는 사라지기 전에 Bing에 의해 인덱싱되었습니다.
GitHub의 z-ai-sdk-java 저장소에서 GLM 5.3에 대한 커밋 브랜치가 확인되었습니다.
새로운 DeepSeek V4-Flash 모델은 ArtificialAnalysis 지수에서 50점을 기록했습니다. 이 결과는 GLM-5.2 및 GPT-5.6 Luna보다 단 한 점 낮은 위치를 차지합니다.
연구자들은 컴퓨터 사용 에이전트 궤적에 대한 심판 역할을 하는 비전-언어 모델(VLM)의 신뢰성을 평가하기 위해 설계된 현실적인 벤치마크인 OSReward를 소개합니다. 이 연구는 최신 VLM조차도 체계적인 관용 편향에 시달리며 규모 확장에 너무 비싸다는 점을, 반면 저렴한 오픈 모델은 성능이 낮다는 점을 보여줍니다.
xAI는 SuperGrok Heavy 구독자를 위해 "빌드 모드"를 출시하여, 사용자가 설정 없이 채팅에서 직접 웹사이트, 앱, 게임, 대시보드를 생성하고 편집하며 미리 보고 게시할 수 있도록 했습니다. 동시에 선진 AI 기업들의 천 명 이상의 직원들이 자동화된 AI 개발의 최전선을 의도적으로 조절하기 위한 도구를 개발하는 데 대한 국제적 노력을 미국 정부가 지원해 줄 것을 요청하는 성명에 서명했습니다.
llama.cpp 프로젝트는 GLM_DSA (GLM-5.2) 모델 아키텍처를 위한 NextN/MTP 추측 디코딩 지원을 도입하는 빌드 b10174을 출시했습니다.
문샷은 토큰당 약 104B의 활성 파라미터를 가진 2.8T 파라미터 MoE 모델인 Kimi K3의 전체 세부 사항, 가중치 및 지원 인프라를 출시했습니다. 이번 출시에는 하이브리드 긴 컨텍스트 스택과 MoonEP, FlashKDA, AgentEnv와 같은 새로운 도구에 대한 기술 보고서가 포함되어 있습니다.
PIVOT(Proxy Indexing Via One full-prefix Traversal)은 DeepSeek Sparse Attention(DSA) 인덱서를 위한 학습 불필요한 드롭인 대체재로, 근처 쿼리 그룹 간에 하나의 접두사 스캔을 공유하여 계산 중복성을 줄입니다. PIVOT은 각 쿼리에 대해 개별적으로 모든 선행 토큰을 점수 매기는 대신, 그룹을 단일 프록시 쿼리로 집계하여 후보 집합을 얻고, 여기서 각 쿼리별로 상위 k개 토큰을 선택합니다.
이 보고서는 Zing를 소개합니다. Zing는 대규모 언어 모델의 사회적 지능을 측정하고, 내재화하며, 기반 추론함으로써 향상시키는 데 설계된 통합 프레임워크입니다. 저자들은 17개의 하위 차원과 3,481명의 전문가가 검증한 인스턴스를 아우르는 심리학 기반 벤치마크인 SoMBench를 제시합니다. 이는 현재 LLM에 상당한 개선의 여지가 있으며 어떤 모델도 거의 최고점 성능에 도달하지 못했음을 보여줍니다.
세 가지 오픈 가중치 희소 Mixture-of-Experts 모델인 Moonshot AI의 Kimi K3, DeepSeek V4 Pro, Zhipu AI의 GLM-5.2를 비교하여 장기적 코딩 및 에이전트 워크로드에 대한 능력, 라이선스 조건, 서빙 비용을 평가합니다.