연구소 · Zhipu AI
media MarkTechPost · 17시간 전 · 조회수 2회

Z.ai, 사후 학습을 통한 코딩 및 사이버보안 기능 개선을 갖춘 GLM-5.3 출시

Z.ai는 743B 파라미터 모델의 업데이트인 GLM-5.3을 출시했으며, 이는 기본 모델 재학습이 아닌 확장된 사후 학습을 통해 성능 향상을 달성했다. 이번 릴리스는 현재 Z.ai API, GLM Coding Plan, ZCode를 통해 이용 가능하며, 공개 가중치는 안전성 평가 후 약 2주 후에 출시될 예정이다.

arxiv arXiv cs.LG · 2일 전 HealthBench · 51.9% · 조회수 5회

VITA 임상 RAG 시스템이 HealthBench에서 최전방 LLM과 동등하거나 우수함

저소득 및 중소득 환경을 위해 설계된 전용 검색 증강 생성(RAG) 시스템인 VITA가 HealthBench 벤치마크에서 범용 대규모 언어 모델에 대해 평가되었습니다. GPT-4.1 심판이 채점한 4,023개의 질문에 대해 VITA는 가능한 루브릭 포인트의 51.9%를 획득하여 1위를 차지했으며, GPT-5.4, o4-mini, Gemini 3.1 Pro 및 Claude Sonnet 4.6을 앞질렀습니다.

arxiv arXiv cs.LG · 4일 전 · 조회수 2회

Macaron-V1이 Mixture-of-LoRA를 활용한 지속 학습용 오픈 에이전트 모델 패밀리 출시

Macaron-V1은 실제 환경에서 학습하고 배포 후에도 학습을 계속할 수 있도록 설계된 경험적 지능용 오픈 에이전트 모델 패밀리입니다. 이 시스템은 두 가지 목표에 중점을 둡니다: 모델-하arness 쌍의 재귀적 개선을 통한 적응과, 사용자 턴마다 전문가 LoRA 어댑터를 선택하는 Mixture-of-LoRA (MoL) 아키텍처를 통한 협업.

arxiv arXiv cs.CL · 4일 전 · 조회수 10회

Macaron-V1이 지속적 학습을 위한 Mixture-of-LoRA와 함께 오픈 에이전트 모델 패밀리 출시

Macaron-V1은 경험적 지능을 위해 설계된 오픈 에이전트 모델 패밀리로, 시스템이 실제 세계의 경험으로부터 학습하고 배포 후에도 지속적으로 개선할 수 있도록 합니다. 이 아키텍처는 두 가지 목표를 중심으로 합니다: 모델-하니스 쌍의 재귀적 자기 개선을 통한 적응과, 사용자 턴마다 전문가 어댑터를 선택하는 Mixture-of-LoRA(MoL) 시스템을 통한 협업.

arxiv arXiv cs.CL · 15일 전 · 조회수 4회

OSReward는 크로스플랫폼 컴퓨터 사용 보상 모델에 대한 표준화된 평가를 도입합니다

연구자들은 컴퓨터 사용 에이전트 궤적에 대한 심판 역할을 하는 비전-언어 모델(VLM)의 신뢰성을 평가하기 위해 설계된 현실적인 벤치마크인 OSReward를 소개합니다. 이 연구는 최신 VLM조차도 체계적인 관용 편향에 시달리며 규모 확장에 너무 비싸다는 점을, 반면 저렴한 오픈 모델은 성능이 낮다는 점을 보여줍니다.

media TLDR AI · 17일 전 · 조회수 34회

xAI가 빌드 모드 출시; 연구자들이 AI 발전 속도 조절 협약을 촉구

xAI는 SuperGrok Heavy 구독자를 위해 "빌드 모드"를 출시하여, 사용자가 설정 없이 채팅에서 직접 웹사이트, 앱, 게임, 대시보드를 생성하고 편집하며 미리 보고 게시할 수 있도록 했습니다. 동시에 선진 AI 기업들의 천 명 이상의 직원들이 자동화된 AI 개발의 최전선을 의도적으로 조절하기 위한 도구를 개발하는 데 대한 국제적 노력을 미국 정부가 지원해 줄 것을 요청하는 성명에 서명했습니다.

arxiv arXiv cs.CL · 18일 전 · 조회수 3회

PIVOT이 쿼리 그룹 간 접두사 스캔을 공유하여 토큰 수준 희소 어텐션을 가속화

PIVOT(Proxy Indexing Via One full-prefix Traversal)은 DeepSeek Sparse Attention(DSA) 인덱서를 위한 학습 불필요한 드롭인 대체재로, 근처 쿼리 그룹 간에 하나의 접두사 스캔을 공유하여 계산 중복성을 줄입니다. PIVOT은 각 쿼리에 대해 개별적으로 모든 선행 토큰을 점수 매기는 대신, 그룹을 단일 프록시 쿼리로 집계하여 후보 집합을 얻고, 여기서 각 쿼리별로 상위 k개 토큰을 선택합니다.

arxiv arXiv cs.CL · 18일 전 · 조회수 2회

Zing 프레임워크가 SoMBench 벤치마크와 Actio 기반 추론을 통해 LLM의 사회적 지능을 향상

이 보고서는 Zing를 소개합니다. Zing는 대규모 언어 모델의 사회적 지능을 측정하고, 내재화하며, 기반 추론함으로써 향상시키는 데 설계된 통합 프레임워크입니다. 저자들은 17개의 하위 차원과 3,481명의 전문가가 검증한 인스턴스를 아우르는 심리학 기반 벤치마크인 SoMBench를 제시합니다. 이는 현재 LLM에 상당한 개선의 여지가 있으며 어떤 모델도 거의 최고점 성능에 도달하지 못했음을 보여줍니다.