지난달 중국에서 네 개의 대규모 언어 모델이 출시되었습니다: Kimi K3-2.8T, Qwen3.8-2.4T, DeepSeek-V4-Pro-0813-1.6T, GLM-5.3-743B.
media
r/LocalLLaMA
·
8시간 전
·
open_models
Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813, GLM-5.3 한 달 내 출시
번역 English → 한국어
관련 기사
media
AI News (smol.ai)
·
2일 전
·
조회수 11회
xAI, Grok 4.6 출시; 알리바바, Qwen3.8-MoE 오픈; DeepSeek V4 Pro GA
이번 주 AI 뉴스는 xAI, 알리바바, DeepSeek의 주요 릴리스와 함께 오픈 비디오 모델 및 추론 인프라 업데이트를 강조합니다.
media
Interconnects
·
12일 전
·
조회수 11회
Thinking Machines가 Inkling 출시, Tencent가 Apache 2.0 라이선스로 Hy3 업데이트
최신 오픈 모델 아티팩트 요약에서는 Thinking Machines와 Tencent의 주요 릴리스와 함께 Poolside 및 DeepSeek의 업데이트가 강조됩니다.
media
TLDR AI
·
25일 전
·
조회수 6회
Qwen3.8 오픈 가중치 출시, Kimi Code CLI, 넷플릭스 LLM 스택, 알리바바 칩 소프트웨어
알리바바는 2.4조 파라미터를 가진 Qwen3.8의 오픈 가중치 출시를 발표했으며, 엔비디아 CUDA 생태계 의존도를 줄이기 위해 Zhenwu AI 칩 소프트웨어 스택도 오픈소스로 공개했다.
media
MarkTechPost
·
27일 전
·
조회수 24회
Kimi K3, DeepSeek V4 Pro, GLM-5.2 벤치마크, 라이선스, 서빙 비용 비교
세 가지 오픈 가중치 희소 Mixture-of-Experts 모델인 Moonshot AI의 Kimi K3, DeepSeek V4 Pro, Zhipu AI의 GLM-5.2를 비교하여 장기적 코딩 및 에이전트 워크로드에 대한 능력, 라이선스 조건, 서빙 비용을 평가합니다.
arxiv
arXiv cs.CL
·
36일 전
deepseek-r1:8B를 Qwen3-0.6B로 증류하면 빠른 온디바이스 구조화된 텍스트 보강이 가능해집니다
연구자들은 8B 추론 교사 모델(deepseek-r1:8B)을 0.6B 학생 모델(QLoRA를 통한 Qwen3-0.6B)로 증류함으로써 현저히 낮은 지연 시간과 비용으로 대량의 구조화된 추출을 가능하게 한다고 입증했습니다. 이 연구는 요약 및 범주형 레이블이 포함된 JSON 객체로 뉴스 기사를 매핑하는 이 접근 방식을 평가하며, 증류된 모델을 퓨샷 프롬프팅 및 제약 디코딩 베이스라인과 비교했습니다.