Qwen 팀은 Artificial Analysis 에이전틱 인덱스에서 Opus 5 Medium보다 우수한 Qwen3.8 27B 모델을 출시했습니다.
- Qwen3.8 27B는 Artificial Analysis 에이전틱 인덱스 벤치마크에서 Opus 5 Medium보다 높은 점수를 달성했습니다.
Qwen 팀은 Artificial Analysis 에이전틱 인덱스에서 Opus 5 Medium보다 우수한 Qwen3.8 27B 모델을 출시했습니다.
Claude Opus 5.5가 출시되어 SimpleBench에서 88.4%의 점수로 선두를 차지했으며, 고품질 설명 영상을 생성하는 능력으로 커뮤니티의 큰 관심을 받고 있습니다.
연구진은 SkillGym을 소개합니다. 이는 인간이 작성한 에이전트 기술을 대형 언어 모델 에이전트를 위한 실행 가능하고 검증 가능한 학습 환경으로 변환하는 프레임워크입니다. 이 시스템은 기술-작업 파이프라인을 활용하여 구체적인 작업을 인스턴스화하고 코드 기반 체크기로 결과를 검증합니다.
오픈소스 모델 중립형 에이전트 허브인 TrueForge의 개발자들은 DevRev Enterprise-Bench를 사용하여 이를 Claude Managed Agents와 벤치마킹했습니다. 비교 결과, TrueForge는 관리되는 플랫폼의 해결률을 맞추면서도 자원 소비를 크게 줄일 수 있는 것으로 나타났습니다.
Anthropic은 코딩 및 지식 작업용 새로운 플래그십 모델로 Claude Fable 5.1과 Claude Mythos 5.1을 출시했으며, 이를 자율적 다단계 작업에 대한 세계 최고 수준의 모델로 포지셔닝했습니다.
오로보로스는 도구, 프롬프트 및 핵심 구현이 검토된 커밋을 통해 개선되고, 이 커밋들이 후속 작업의 런타임이 되는 자기 개발 에이전트 허브입니다. 이는 사용 중에 발견된 버그와 비효율성에 의해 트리거되는 재귀적 자유 진화 또는 경험 기반 핵심 진화를 통해 작동합니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침