출처 · arXiv cs.AI
arxiv arXiv cs.AI · 1일 전

AutoDesign은 메타-하니스 최적화를 사용하여 장기 에이전트 설계를 개선합니다

논문에서는 AutoDesign을 소개합니다. 이는 롤아웃 피드백을 기반으로 코드 에이전트의 하니스를 재귀적으로 개선하도록 안내하기 위해 메타-하니스 옵티마이저를 사용하는 프레임워크입니다. 이 접근 방식은 인간의 설계 사전 지식과 정렬하고 재귀적 자기 개선을 위해 재사용 가능한 경험을 축적하는 것을 목표로 합니다.

arxiv arXiv cs.AI · 2일 전 · 조회수 3회

SCOUT가 구조화된 CoT와 프로세스 감독 강화학습을 통해 VLM의 공간 추론을 향상시킴

연구자들은 SCOUT를 제안했는데, 이는 구조화된 사고사슬과 다목적 프로세스 보상 강화학습을 결합하여 비전-언어 모델의 공간 추론을 향상시키는 프레임워크입니다. 이 접근법은 기존 RL 방법의 신용 할당 문제를 해결하고 포괄적인 3D 이해를 위해 깊이 지각을 통합합니다.

arxiv arXiv cs.AI · 2일 전 HealthBench · 51.9% · 조회수 4회

VITA 임상 RAG는 HealthBench에서 최첨단 LLM과 동등하거나 이를 능가

저소득 및 중산층 국가를 위해 설계된 목적 특화 검색 증강 생성 시스템인 VITA가 HealthBench 벤치마크에서 범용 대규모 언어 모델들과 비교 평가되었습니다. 이 연구는 새로운 최첨단 모델이 출시됨에 따라라도 코퍼스 특화 설계가 경쟁력 있는 성능을 유지할 수 있음을 보여줍니다.

arxiv arXiv cs.AI · 3일 전

MiLMMT-46-v1.0, 레퍼런스 없는 사후 학습을 통한 다국어 번역 성능 향상

연구진은 오픈 대규모 언어 모델에 레퍼런스 없는 사후 학습을 적용하는 다국어 기계 번역 모델인 MiLMMT-46-v1.0을 개발했습니다. 연구팀은 언어 식별에 의해 게이트되는 두 개의 레퍼런스 없는 품질 추정 모델을 기반으로 한 보상과 함께 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)를 사용합니다.

arxiv arXiv cs.AI · 4일 전

오픈 엔디드 최적화가 GPT-5.5에게 자체 개선 과정 작성을 가능하게 하다

본 기사는 오픈 엔디드 최적화(OEO)를 소개합니다. 이는 프론티어 모델 옵티마이저가 지정된 최적화 파이프라인에 의존하는 대신 온라인으로 자체 개선 과정을 동적으로 구성할 수 있게 하는 프레임워크입니다. 저자들은 8개의 벤치마크-대상-모델 설정에서 14번의 직접 비교를 통해 OEO를 SkillOpt와 GEPA라는 두 단계적 접근법과 비교했습니다.

arxiv arXiv cs.AI · 4일 전

AMIE (Video)가 실시간 의료 상담에서 전문가 수준의 성능 달성

연구자들은 저지연 대화를 실시간 오디오비주얼 지각과 통합하는 Gemini 기반 멀티 에이전트 시스템인 AMIE (Video)를 사용하여 실시간 임상 비디오 상담을 위한 최초의 전문가 수준 AI 시스템을 시연했습니다. 30명의 일차 진료 의사 및 100개의 시나리오가 포함된 무작위 구조화 임상 시험 연구에서 임상 평가자들은 병력 청취, 진단, 관리 및 신체 관찰에서 시스템을 의사들과 동등하거나 더 우수하다고 평가했습니다.

arxiv arXiv cs.AI · 4일 전 · 조회수 17회

공격자가 암호화된 블록 취약점을 통해 독점 LLM API에서 추론 추적을 탈취

연구자들은 주요 대규모 언어 모델 제공업체가 단계별 추론 추적을 처리하는 방식의 아키텍처적 취약점을 발견했습니다. 제공업체는 이러한 추적을 클라이언트에게 암호화된 블록으로 반환하지만, 연구 결과 해당 블록은 제공업체 생태계 내의 서로 다른 세션, 사용자 및 모델 간에 완전히 호환되고 교체 가능함이 밝혀졌습니다.

arxiv arXiv cs.AI · 4일 전 OSWorld · 90.69% · 조회수 6회

오로보로스 자기 개발 에이전트가 Opus 5로 새로운 벤치마크 기록 수립

오로보로스는 도구, 프롬프트 및 핵심 구현이 검토된 커밋을 통해 개선되고, 이 커밋들이 후속 작업의 런타임이 되는 자기 개발 에이전트 허브입니다. 이는 사용 중에 발견된 버그와 비효율성에 의해 트리거되는 재귀적 자유 진화 또는 경험 기반 핵심 진화를 통해 작동합니다.

arxiv arXiv cs.AI · 4일 전

상펑이 자기진화형 안전 가드레일 시스템 SESG를 배포하다

상펑은 프로덕션 환경에서 새로운 위협에 맞춰 LLM 안전 방어책을 지속적으로 적응시키는 다중 에이전트 시스템인 SESG(Self-Evolving Safety Guardrails)를 배포했습니다. 이 시스템은 실시간 트래픽을 모니터링하여 새로운 탈옥 기법과 유해 카테고리들을 감지한 후, 수동 개입 없이 자동으로 학습 데이터를 합성하고 모델을 업데이트합니다.

arxiv arXiv cs.AI · 5일 전 · 조회수 12회

GPT-5와 GPT-5 Nano가 미생물 발암 연구 평가에서 전문가 수준에 도달

GPT-5와 GPT-5 Nano가 미생물 발암 관련 연구 논문의 증거 추출 및 비판적 평가에서 전문가 수준의 성능을 달성했음을 보여주는 연구 결과가 발표되었습니다. 연구진은 MMTV-LV와 유방암에 초점을 맞춘 24편의 논문 데이터셋을 사용하여 도메인 전문가들과 함께 Gemini 2.5 Pro 및 Gemini 2.5 Flash 모델과 함께 이러한 모델들을 벤치마킹했습니다.

arxiv arXiv cs.AI · 9일 전 SWE-bench Pro · 78.0% · 조회수 1회

Argus: 장기적 추론을 위한 범용 에이전트 런타임

연구자들은 안정적인 사용자 의도와 운영 목표를 분리하여 장기적 추론에 특화된 영속적이고 자기 진화하는 에이전트 런타임인 Argus를 제시한다. 이 시스템은 Manager, Planner, Engineer, Reviewer 역할을 활용하여 내구성 있는 프로젝트 상태 위에서 제한된 임무를 실행하며, 운영자가 소유한 에스컬레이션 지점 간 자율적 실행을 가능하게 한다.

arxiv arXiv cs.AI · 9일 전

SciCode-Verified는 벤치마크 결함을 수정하여 모델의 진정한 과학적 코딩 능력을 드러낸다

저자들은 SciCode 벤치마크에서의 점수 정체 현상이 모델 능력의 한계가 아니라 평가 도구의 중대한 결함에서 비롯된 것임을 확인했습니다. 65개의 테스트 문제에 대한 도메인 전문가 감사 결과 263개의 결함이 발견되었으며, 이 중 192개는 재현 불가능한 정답과 지나치게 엄격한 허용 오차 등의 문제로 인해 올바른 솔루션이 잘못 거부되는 원인이 되었습니다.

arxiv arXiv cs.AI · 10일 전

Video-DeepResearch가 연속 비디오 스트림을 위한 멀티모달 에이전트 소개

연구자들은 Video-DeepResearch (Video-DR)를 소개했는데, 이는 정적 이미지에서 연속 비디오 스트림으로 멀티모달 에이전트를 확장하는 프레임워크로, 모달 편향과 매개변수 지식 누수를 해결합니다. 이 시스템은 웹 검색 전에 프레임 간 시각적 기반을 확립하기 위해 단계별 도구 잠금 해제와 함께 분리된 지각-탐색 파이프라인을 사용합니다.

arxiv arXiv cs.AI · 15일 전 WebArena · 73.6% · 조회수 4회

Qwen-UI-Agent가 모바일 사용 벤치마크에서 최첨단 성능을 달성하다

Qwen 팀은 모바일, 컴퓨터 사용, 웹 및 DeepSearch 환경 전반에 걸쳐 신뢰성 있게 작동하도록 설계된 현실 중심의 기반 GUI 에이전트인 Qwen-UI-Agent에 대한 기술 보고서를 출시했습니다. 이 시스템은 다양한 샌드박스 환경과 대규모 실제 기기 모바일 런타임을 결합하여 GUI 작업과 CLI 실행을 교차시키고 장기적 작업을 지원합니다.

arxiv arXiv cs.AI · 18일 전 · 조회수 1회

ClinFusion이 전신 의학 이해를 위한 비전 중심 MLLM을 소개합니다

연구자들은 ClinFusion을 소개했습니다. 이는 2D와 3D 의료 영상 이해를 통합하여 임상 현장에 AI를 배포하는 과제를 해결하도록 설계된 비전 중심 멀티모달 대규모 언어 모델입니다. 이 시스템은 Cascade Spatial-Aware Locality Fusion 연산자를 갖춘 구성적 캐스케이디드 비전 인코더를 특징으로 하며, MedIF-Bench와 관심 영역 기반 지표로 구성된 새로운 평가 프레임워크를 포함합니다.

arxiv arXiv cs.AI · 18일 전

Aethis Eligibility Module는 신경-기호 아키텍처를 사용하여 LLM 규칙 평가 오류를 수정합니다

본 기사는 exception chain collapse라고 불리는 최전방 대규모 언어 모델의 실패 클래스를 문서화하고 있으며, 여기서 모델은 중첩된 조건부 규칙을 잘못 평가합니다. 이를 해결하기 위해 저자들은 Aethis Eligibility Module을 제시하는데, 이는 LLM이 작성한 규칙과 결정론적 실행을 위한 SMT 기반 레이어를 결합한 신경-기호 아키텍처입니다.

arxiv arXiv cs.AI · 22일 전 OSWorld · 37.7% · 조회수 5회

OpenForgeRL은 모든 환경에서 하네스 기반 에이전트의 엔드투엔드 학습을 가능하게 합니다

OpenForgeRL은 연구자들이 표준 강화학습 스택을 사용하여 하네스 기반 AI 에이전트를 엔드투엔드로 학습할 수 있게 해주는 오픈소스 프레임워크입니다. 이는 모델 호출을 데이터로 기록하는 경량 프록시와 원격 컨테이너 롤아웃을 관리하는 Kubernetes 오케스트레이터를 통해 학습과 추론을 분리함으로써 이를 달성합니다.

arxiv arXiv cs.AI · 23일 전 · 조회수 4회

SLAI의 T-Rex가 Ascend SuperPOD에서 DeepSeek-V4의 전체 파라미터 사후 학습을 가능하게 함

SLAI는 Ascend NPU SuperPOD에서 트릴리언 파라미터 규모의 MoE 모델에 대한 전체 파라미터 사후 학습을 위한 엔드투엔드 최적화 프레임워크인 T-Rex를 소개합니다. DeepSeek-V4 모델 계열을 대상 워크로드로 사용하여, 이 시스템은 계층적 병렬 처리 및 커널 실행 최적화를 통해 메모리 압박과 통신 오버헤드를 해결합니다.