이번 주 AI 뉴스는 Z.ai, 텐센트, 알리바바의 주요 오픈 가중치 모델 출시와 추론 인프라 및 에이전트 벤치마킹 관련 발전을 강조합니다.

  • Z.ai는 에이전트 코딩과 사이버 방어를 위한 744B 총 파라미터를 가진 GLM-5.3을 출시했으며, Flash 변형 버전은 더 낮은 비용으로 더 높은 품질을 제공합니다.
  • 텐센트는 코드 생성 작업에서 Hy3 대비 상당한 성능 향상을 보여주는 770B MoE 모델인 Hy4-preview를 출시했습니다.
  • 알리바바는 저렴하고 긴 컨텍스트의 멀티모달 추론을 위해 설계된 125B MoE 모델인 Qwen3.8-Flash를 소개했으며, 초기 보고서에서는 FP8 양자화 관련 안정성 문제를 지적했습니다.
  • vLLM은 추론적 디코딩 방법들을 비교한 벤치마크를 발표하며 보편적인 승자가 없음을 확인하고 워크로드별 튜닝의 중요성을 강조했습니다.
  • 알리바바 Accio는 실제 작업 완수를 측정하는 107개 과제의 벤치마크인 CommerceAgentBench를 오픈소스로 공개했습니다.
  • 구글 연구에 따르면 영구 위키에 저장된 이동형 스킬은 모델 패밀리 간 효과적으로 이전되어 파인튜닝보다 더 강력한 에이전트 능력을 제공할 가능성이 있습니다.