주제 · Benchmark results
media AI News (smol.ai) · 10일 전 Terminal-Bench 2 · 67.4% · 조회수 21회

알리바바, 2.4T 파라미터를 갖춘 Qwen3.8-Max와 향후 오픈 가중치 발표

알리바바는 새로운 플래그십 모델인 Qwen3.8-Max를 발표했으며, 이는 장기적 에이전트 작업, 코딩, 다중 모달 추론에 중점을 둔 2.4T 파라미터의 희소 아키텍처라고 설명했습니다. 회사는 다음 주 Qwen3.8-27B 변형과 함께 Qwen3.8-Max의 오픈 가중치를 출시할 것이라고 확인했습니다.

media Together AI Blog · 21일 전 · 조회수 8회

Kimi K3는 DeepSWE 품질에서 Claude Fable 5와 동급이며 비용은 1/3 수준

Moonshot AI의 오픈 가중치 모델인 Kimi K3는 DeepSWE 벤치마크에서 Anthropic의 Claude Fable 5와 비교할 만한 성능을 달성하면서도 작업당 비용이 훨씬 저렴합니다. 2026년 7월 16일 평가에서 Kimi K3는 pass@1 기준 68.5%를 기록하여 Fable 5의 69.9%에 근접했으나, 다중 시도 시나리오에서는 이를 능가하며 뛰어난 비용 효율성을 보였습니다.

arxiv τ²-bench (tau2-bench) · 23일 전 · 조회수 3회

τ-bench 1.0.1이 banking_knowledge 채점 방식을 수정하여 신중한 에이전트 행위에 대한 페널티 방지

Sierra Research가 τ-bench 1.0.1을 출시하여 `banking_knowledge` 작업의 채점 방식을 수정하고, 신중한 검증 읽기 수행에 대해 에이전트에 페널티를 부과하지 않도록 하며 여러 데이터 불일치를 수정했습니다. 이 업데이트는 리더보드 재채점 시 점수가 상승만 하도록 보장하며, 이전에 통과했던 시뮬레이션이 실패하지 않습니다.

media Latent Space · 29일 전 · 조회수 3회

문샷 AI가 2.8T 파라미터 오픈 프론티어 모델인 Kimi K3 출시

문샷 AI는 총 2.8조 개의 파라미터와 네이티브 멀티모달 입력 기능을 갖춘 새로운 프론티어 클래스 오픈 가중치 모델인 Kimi K3를 소개했습니다. 공식적으로 "오픈 프론티어 인텔리전스"로 포지셔닝된 이 모델은 100만 토큰의 컨텍스트 윈도우를 지원하며, 효율성을 높이기 위해 Kimi Delta Attention(KDA)와 Attention Residuals와 같은 새로운 아키텍처 구성 요소를 활용합니다.

arxiv arXiv cs.AI · 2일 전 HealthBench · 51.9% · 조회수 4회

VITA 임상 RAG는 HealthBench에서 최첨단 LLM과 동등하거나 이를 능가

저소득 및 중산층 국가를 위해 설계된 목적 특화 검색 증강 생성 시스템인 VITA가 HealthBench 벤치마크에서 범용 대규모 언어 모델들과 비교 평가되었습니다. 이 연구는 새로운 최첨단 모델이 출시됨에 따라라도 코퍼스 특화 설계가 경쟁력 있는 성능을 유지할 수 있음을 보여줍니다.