Qwen 팀은 Artificial Analysis 에이전틱 인덱스에서 Opus 5 Medium보다 우수한 Qwen3.8 27B 모델을 출시했습니다.
- Qwen3.8 27B는 Artificial Analysis 에이전틱 인덱스 벤치마크에서 Opus 5 Medium보다 높은 점수를 달성했습니다.
Qwen 팀은 Artificial Analysis 에이전틱 인덱스에서 Opus 5 Medium보다 우수한 Qwen3.8 27B 모델을 출시했습니다.
오로보로스는 도구, 프롬프트 및 핵심 구현이 검토된 커밋을 통해 개선되고, 이 커밋들이 후속 작업의 런타임이 되는 자기 개발 에이전트 허브입니다. 이는 사용 중에 발견된 버그와 비효율성에 의해 트리거되는 재귀적 자유 진화 또는 경험 기반 핵심 진화를 통해 작동합니다.
Anthropic은 토큰당 약 절반의 가격으로 Claude Fable 5의 성능을 맞추면서도 더 관대한 콘텐츠 분류기를 제공하는 Claude Opus 5를 출시했습니다. 이는 Claude Max의 새로운 기본 모델이며 Claude Pro 사용자를 위한 최강의 옵션입니다.
Agent Arena 리더보드에 따르면 Kimi K3은 비시각 작업에서 Opus와 비교 가능한 수준의 성능을 보입니다. 일부 사용자는 Opus가 시각 기능에서 우위를 가질 수 있다고 지적하지만, 순위는 다른 사용 사례에서 동등함을 나타냅니다.
저자들은 에이전트 쇼핑 워크플로우에서 언어 이해와 아이템 충족 사이의 격차를 해소하기 위해 설계된 파운데이션 모델인 ShopX를 제안합니다. 기존 접근 방식이 LLM을 별도의 검색 파이프라인에 래핑하는 것과 달리, ShopX는 시맨틱 ID(SIDs)를 사용하여 모델이 아이템 공간 내에서 직접 작동할 수 있도록 합니다.
연구자들은 PaperPilot을 소개했습니다. 이는 underspecified하고 진화하는 사용자 의도에 대응하기 위해 과학적 검색을 워크플로우 유도로 프레임하는 다중 턴 문헌 검색 에이전트입니다. 앵커 논문과 쿼리가 주어지면 시스템은 검색 연산자의 실행 가능한 DAG를 구성하며, 이는 사용자 피드백을 통해 정제될 수 있습니다.