Anthropic, Claude Projects v2 출시; Google, 가족 에이전트 도입
Anthropic은 폴더 기반 구조에서 대화형 인터페이스로 기능을 재설계하여 작업 위임과 병렬 스레드를 통해 빌드를 관리하는 Claude Projects v2를 출시했습니다. 동시에 Google은 최대 6명의 가구 구성원의 활동을 조정하기 위해 전용 클라우드 컴퓨터에서 작동하는 가족 에이전트를 테스트하고 있습니다.
Anthropic은 폴더 기반 구조에서 대화형 인터페이스로 기능을 재설계하여 작업 위임과 병렬 스레드를 통해 빌드를 관리하는 Claude Projects v2를 출시했습니다. 동시에 Google은 최대 6명의 가구 구성원의 활동을 조정하기 위해 전용 클라우드 컴퓨터에서 작동하는 가족 에이전트를 테스트하고 있습니다.
이번 업데이트는 AI 환경의 여러 발전을 다루며, 메타가 Muse 플랫폼을 서드파티 개발자에게 개방하고, 세그멘테이션 모델의 새 버전을 출시하며, Google의 Gemini와 관련된 보안 사고를 포함합니다.
샤오미는 대화형 3D 장면을 구축하고 시각적으로 테스트하기 위해 에이전트를 조정하도록 설계된 MiMo-V2.6 Pro 및 Flash 오모다모델 모델을 오픈소스화했습니다. 이 모델은 Blender 애셋을 생성하고, 카메라 피드에서 로봇 팔을 제어하며, 프론트엔드와 프레젠테이션을 제작하고, 비디오를 조립하고, 악보와 MIDI로 음악을 작곡할 수 있습니다.
연구원들은 AIDE^2를 제시했으며, 이는 자체 코드를 최적화하여 AI 연구 에이전트에 대한 재귀적 자기 개선 루프를 구현하는 시스템입니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, 수정된 버전을 AI R&D 작업에서 벤치마킹하며, 숨겨진 평가에서 가장 잘 수행되는 개선 사항만 유지합니다.
저자들은 Growing Harness를 소개합니다. 이는 표준적인 컨텍스트 중심의 하네스에 의존하는 대신 작업 피드백으로부터 에이전트의 제어 구조를 학습하는 훈련 패러다임입니다. 반복되는 제어 결정을 실행 가능한 코드로 변환하고 LLM 호출은 의미론적 추론에 할당함으로써, 이 방법은 재사용 가능한 전문 에이전트를 만드는 것을 목표로 합니다.
연구원들은 CliffCompaction을 소개했습니다. 이는 제한된 컨텍스트 하에서 장기적 코딩 에이전트의 비용을 최대 50%까지 줄이기 위해 설계된 자동 압축 기술입니다. 이 방법은 Terminal-Bench에서 성능을 유지하거나 향상시키며, 재문장화 대신 잘라내기를 통해 압축된 정보를 정확하게 유지함으로써 KernelBench에서 최첨단 결과를 달성합니다.
연구자들은 최첨단 AI 연구 에이전트의 자체 코드를 최적화하여 재귀적 자기 개선 루프를 구현하는 시스템인 AIDE^2를 제시했습니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, AI R&D 작업에서 수정된 버전을 벤치마킹하며, 숨겨진 평가에서 가장 우수한 성능을 보이는 업데이트만 유지합니다.
연구원들은 수백만 개의 토큰을 처리하는 에이전트를 위해 설계된 자동 압축 기법인 CliffCompaction을 소개했으며, 이는 제한된 컨텍스트 하에서 비용을 최대 50%까지 절감합니다. 이 방법은 Terminal-Bench에서 성능을 유지하거나 향상시키며, 재표현이 아닌 잘라내기를 통해 정보를 정확하게 유지함으로써 KernelBench에서 최첨단 결과를 달성했습니다.
연구자들은 중앙 오케스트레이터 병목을 제거하고 동시 작업자가 하위 작업을 비동기적으로 주장하며 진행을 병합할 수 있도록 하는 확장 가능한 자기 조직화 멀티에이전트 하네스인 Agensh를 소개했습니다.
Alibaba Cloud는 이전 오미 모델에 비해 멀티모달 이해와 추론을 크게 향상시키는 실세계 생산성 작업을 위해 설계된 네이티브 멀티모달 에이전트 모델인 Qwen3.8-Omni-Flash를 소개했습니다.
SpaceXAI는 Cursor 인수 이후 통합 고객 지원 운영에 Grok Bot AI 에이전트를 통합하여, 인력 추가 없이 지원 티켓이 175% 증가하는 상황을 관리할 수 있게 되었다. 이 회사는 약 200명의 신규 직원 채용을 피하고, Grok Bot의 사용량 기반 가격 모델을 활용하여 티켓당 해결 비용을 $0.20에서 $0.30 사이로 낮췄다.
Parallel은 AI 에이저 인프라에 OpenAI의 GPT-6 Astra를 통합하여 이전 모델 대비 연구 시간과 코드 비용을 각각 50% 절감했습니다. 회사는 새로운 모델이 고품질 출력을 유지하면서 복잡한 지식 작업을 훨씬 빠르게 완료할 수 있게 한다고 보고합니다.
OpenAI는 기본값으로 더 높은 캐시 히트율을 제공하고 캐시된 입력 토큰에 최대 90% 할인을 제공하는 GPT-6 시리즈용 개선된 프롬프트 캐싱 시스템을 출시했습니다. 이 업데이트는 개발자가 성능을 모니터링하고, 미스 원인을 진단하며, 통합을 최적화할 수 있는 새로운 도구를 도입합니다.
AntLing은 두 개의 6B 파라미터 모델인 Ming-Image-0.1-Design과 Ming-Image-0.1-Design-Layer를 포함한 Ming-Image-0.1-Design 패밀리를 출시했습니다.
Claude Code 버전 2.1.280은 새로운 기본 Opus 모델로 Claude Opus 5.5를 도입했으며, 1M 컨텍스트 창과 업데이트된 가격 정책을 특징으로 합니다. 이번 업데이트는 전체 화면 모드에서 스크롤 목록에 대한 마우스 휠 지원을 추가하고 MCP 도구 설명 길이 제한을 구성할 수 있도록 합니다.
월드 상태 생성기(WSG)는 실패 후 상태를 재작성하여 언어 에이전트의 계획이 실행 환경의 규칙과 일치하도록 유지하는 모델입니다. 이는 규칙을 강제하고 목표 도달 가능성을 검증하는 프로그램이 있는 7개의 합성 도메인에서 추출된 226K 트래젝토리에서 훈련되었습니다.
샤오미는 MiMo-V2.6 시리즈를 출시하며 MiMo-V2.6-Pro와 MiMo-V2.6-Flash를 포함한 네이티브 올모달 모델을 선보였습니다. 또한 회사는 동일한 품질에서 최대 20배 빠른 출력 속도를 제공하는 MiMo-V2.6-Pro-UltraSpeed도 출시했습니다.
새로운 분석은 별도로 관리되는 에이전트 간에 생성된 관계가 그룹 전체에 지배적인 힘을 얻는 다중 에이전트 시스템의 현상을 강조합니다. 이는 에이전트가 지속 가능한 메시지와 아티팩트를 남겨 서로의 궤적을 제약할 때 발생하며, 개별 작업에서 지정되지 않은 효과적인 분산적 지향을 만듭니다.
저자는 대규모 언어 모델(LLM)을 위한 불완전하고 경로 의존적인 메모리를 실험하기 위해 SelMem이라는 Rust 프로젝트를 개발했습니다. 이 접근 방식은 상호 작용의 완벽한 사본을 저장하는 대신 에이전트가 시간이 지남에 따라 기억을 압축, 잊어버리고 재구성할 수 있도록 하여 인간 기억을 모방합니다.
연구자들은 에이전트 워크플로우의 다단계 과정을 최적화하기 위해 AgentRouter를 제안했습니다. 이는 매 작업마다 최상위 모델을 사용하는 대신 개별 궤적 단계를 적절한 모델 계층으로 라우팅하는 경량 분류기입니다. 이 시스템은 단일 에이전트 세션 내에서 하위 작업 복잡성이 다양함을 무시하는 기존 솔루션의 비효율성을 해결합니다.