AI agents
media TLDR AI · 2시간 전 · 조회수 10회

Anthropic, Claude Projects v2 출시; Google, 가족 에이전트 도입

Anthropic은 폴더 기반 구조에서 대화형 인터페이스로 기능을 재설계하여 작업 위임과 병렬 스레드를 통해 빌드를 관리하는 Claude Projects v2를 출시했습니다. 동시에 Google은 최대 6명의 가구 구성원의 활동을 조정하기 위해 전용 클라우드 컴퓨터에서 작동하는 가족 에이전트를 테스트하고 있습니다.

media TLDR AI · 2시간 전 · 조회수 10회

샤오미, MiMo-V2.6 Pro 및 Flash 모델 오픈소스화

샤오미는 대화형 3D 장면을 구축하고 시각적으로 테스트하기 위해 에이전트를 조정하도록 설계된 MiMo-V2.6 Pro 및 Flash 오모다모델 모델을 오픈소스화했습니다. 이 모델은 Blender 애셋을 생성하고, 카메라 피드에서 로봇 팔을 제어하며, 프론트엔드와 프레젠테이션을 제작하고, 비디오를 조립하고, 악보와 MIDI로 음악을 작곡할 수 있습니다.

arxiv arXiv cs.AI · 2시간 전 · 조회수 9회

AIDE^2가 AI 연구 에이전트의 재귀적 자기 개선 가능

연구원들은 AIDE^2를 제시했으며, 이는 자체 코드를 최적화하여 AI 연구 에이전트에 대한 재귀적 자기 개선 루프를 구현하는 시스템입니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, 수정된 버전을 AI R&D 작업에서 벤치마킹하며, 숨겨진 평가에서 가장 잘 수행되는 개선 사항만 유지합니다.

arxiv arXiv cs.AI · 3시간 전 WebArena · 45.3% · 조회수 13회

Growing Harness는 실패 기반 학습을 통해 재귀적 에이전트 제어를 재사용 가능한 코드로 전환합니다

저자들은 Growing Harness를 소개합니다. 이는 표준적인 컨텍스트 중심의 하네스에 의존하는 대신 작업 피드백으로부터 에이전트의 제어 구조를 학습하는 훈련 패러다임입니다. 반복되는 제어 결정을 실행 가능한 코드로 변환하고 LLM 호출은 의미론적 추론에 할당함으로써, 이 방법은 재사용 가능한 전문 에이전트를 만드는 것을 목표로 합니다.

arxiv arXiv cs.AI · 4시간 전 · 조회수 9회

CliffCompaction은 성능을 유지하면서 코딩 에이전트 비용을 50% 절감합니다

연구원들은 CliffCompaction을 소개했습니다. 이는 제한된 컨텍스트 하에서 장기적 코딩 에이전트의 비용을 최대 50%까지 줄이기 위해 설계된 자동 압축 기술입니다. 이 방법은 Terminal-Bench에서 성능을 유지하거나 향상시키며, 재문장화 대신 잘라내기를 통해 압축된 정보를 정확하게 유지함으로써 KernelBench에서 최첨단 결과를 달성합니다.

arxiv arXiv cs.LG · 4시간 전 · 조회수 11회

AIDE^2는 AI 연구 에이전트의 재귀적 자기 개선 기능을 가능하게 합니다

연구자들은 최첨단 AI 연구 에이전트의 자체 코드를 최적화하여 재귀적 자기 개선 루프를 구현하는 시스템인 AIDE^2를 제시했습니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, AI R&D 작업에서 수정된 버전을 벤치마킹하며, 숨겨진 평가에서 가장 우수한 성능을 보이는 업데이트만 유지합니다.

arxiv arXiv cs.LG · 5시간 전 · 조회수 9회

CliffCompaction은 성능을 유지하면서 장기적 코딩 에이전트 비용을 최대 50%까지 절감합니다

연구원들은 수백만 개의 토큰을 처리하는 에이전트를 위해 설계된 자동 압축 기법인 CliffCompaction을 소개했으며, 이는 제한된 컨텍스트 하에서 비용을 최대 50%까지 절감합니다. 이 방법은 Terminal-Bench에서 성능을 유지하거나 향상시키며, 재표현이 아닌 잘라내기를 통해 정보를 정확하게 유지함으로써 KernelBench에서 최첨단 결과를 달성했습니다.

lab xAI News · 10시간 전 · 조회수 15회

SpaceXAI는 Grok Bot을 활용해 채용 없이 티켓 급증 175%를 처리

SpaceXAI는 Cursor 인수 이후 통합 고객 지원 운영에 Grok Bot AI 에이전트를 통합하여, 인력 추가 없이 지원 티켓이 175% 증가하는 상황을 관리할 수 있게 되었다. 이 회사는 약 200명의 신규 직원 채용을 피하고, Grok Bot의 사용량 기반 가격 모델을 활용하여 티켓당 해결 비용을 $0.20에서 $0.30 사이로 낮췄다.

lab OpenAI News · 13시간 전 · 조회수 22회

OpenAI, 더 높은 히트율과 진단 기능으로 GPT-6 프롬프트 캐싱 개선

OpenAI는 기본값으로 더 높은 캐시 히트율을 제공하고 캐시된 입력 토큰에 최대 90% 할인을 제공하는 GPT-6 시리즈용 개선된 프롬프트 캐싱 시스템을 출시했습니다. 이 업데이트는 개발자가 성능을 모니터링하고, 미스 원인을 진단하며, 통합을 최적화할 수 있는 새로운 도구를 도입합니다.

lab Claude Code Releases · 16시간 전 · 조회수 14회

Claude Code v2.1.280이 Claude Opus 5.5를 추가하고 수많은 버그를 수정함

Claude Code 버전 2.1.280은 새로운 기본 Opus 모델로 Claude Opus 5.5를 도입했으며, 1M 컨텍스트 창과 업데이트된 가격 정책을 특징으로 합니다. 이번 업데이트는 전체 화면 모드에서 스크롤 목록에 대한 마우스 휠 지원을 추가하고 MCP 도구 설명 길이 제한을 구성할 수 있도록 합니다.

arxiv arXiv cs.AI · 22시간 전 · 조회수 11회

월드 상태 생성기는 에이전트 성공을 높이기 위해 계획을 합성 세계와 정렬합니다

월드 상태 생성기(WSG)는 실패 후 상태를 재작성하여 언어 에이전트의 계획이 실행 환경의 규칙과 일치하도록 유지하는 모델입니다. 이는 규칙을 강제하고 목표 도달 가능성을 검증하는 프로그램이 있는 7개의 합성 도메인에서 추출된 226K 트래젝토리에서 훈련되었습니다.

media Hugging Face Forums · 1일 전 · 조회수 10회

다중 에이전트 AI의 분산 제약은 집단적 정체성 없이 에이전트를 지배합니다

새로운 분석은 별도로 관리되는 에이전트 간에 생성된 관계가 그룹 전체에 지배적인 힘을 얻는 다중 에이전트 시스템의 현상을 강조합니다. 이는 에이전트가 지속 가능한 메시지와 아티팩트를 남겨 서로의 궤적을 제약할 때 발생하며, 개별 작업에서 지정되지 않은 효과적인 분산적 지향을 만듭니다.

media Hugging Face Forums · 1일 전 · 조회수 10회

jbsalles, LLM을 위한 선택적 메모리 시스템 SelMem 실험

저자는 대규모 언어 모델(LLM)을 위한 불완전하고 경로 의존적인 메모리를 실험하기 위해 SelMem이라는 Rust 프로젝트를 개발했습니다. 이 접근 방식은 상호 작용의 완벽한 사본을 저장하는 대신 에이전트가 시간이 지남에 따라 기억을 압축, 잊어버리고 재구성할 수 있도록 하여 인간 기억을 모방합니다.

arxiv arXiv cs.AI · 1일 전 · 조회수 9회

AgentRouter는 단계별 모델 라우팅을 통해 에이전트 워크플로우 비용을 72% 절감

연구자들은 에이전트 워크플로우의 다단계 과정을 최적화하기 위해 AgentRouter를 제안했습니다. 이는 매 작업마다 최상위 모델을 사용하는 대신 개별 궤적 단계를 적절한 모델 계층으로 라우팅하는 경량 분류기입니다. 이 시스템은 단일 에이전트 세션 내에서 하위 작업 복잡성이 다양함을 무시하는 기존 솔루션의 비효율성을 해결합니다.