AIDE^2가 AI 연구 에이전트의 재귀적 자기 개선 가능
연구원들은 AIDE^2를 제시했으며, 이는 자체 코드를 최적화하여 AI 연구 에이전트에 대한 재귀적 자기 개선 루프를 구현하는 시스템입니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, 수정된 버전을 AI R&D 작업에서 벤치마킹하며, 숨겨진 평가에서 가장 잘 수행되는 개선 사항만 유지합니다.
연구원들은 AIDE^2를 제시했으며, 이는 자체 코드를 최적화하여 AI 연구 에이전트에 대한 재귀적 자기 개선 루프를 구현하는 시스템입니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, 수정된 버전을 AI R&D 작업에서 벤치마킹하며, 숨겨진 평가에서 가장 잘 수행되는 개선 사항만 유지합니다.
저자들은 Growing Harness를 소개합니다. 이는 표준적인 컨텍스트 중심의 하네스에 의존하는 대신 작업 피드백으로부터 에이전트의 제어 구조를 학습하는 훈련 패러다임입니다. 반복되는 제어 결정을 실행 가능한 코드로 변환하고 LLM 호출은 의미론적 추론에 할당함으로써, 이 방법은 재사용 가능한 전문 에이전트를 만드는 것을 목표로 합니다.
연구자들은 최첨단 AI 연구 에이전트의 자체 코드를 최적화하여 재귀적 자기 개선 루프를 구현하는 시스템인 AIDE^2를 제시했습니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, AI R&D 작업에서 수정된 버전을 벤치마킹하며, 숨겨진 평가에서 가장 우수한 성능을 보이는 업데이트만 유지합니다.
연구자들은 중앙 오케스트레이터 병목을 제거하고 동시 작업자가 하위 작업을 비동기적으로 주장하며 진행을 병합할 수 있도록 하는 확장 가능한 자기 조직화 멀티에이전트 하네스인 Agensh를 소개했습니다.
연구자들은 표준, 구성 및 로그에 대한 추론을 통해 엔지니어링 작업을 자동화하도록 설계된 오픈소스 통합 telecom 추론 모델 패밀리인 TelecomGPT-R1을 소개합니다. 이 모델은 프로토콜, 지식, 모델링, 결함 축을 아우르는 구조화된 접근 방식을 통해 기존 범용 및 전문 LLM의 한계를 극복합니다.
저자들은 진단 및 임상 의료 추론을 향상시키기 위해 합성 데이터와 기준 기반 강화 학습을 사용하는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문들에 규칙 유도 RL을 적용한 후, 상호작용 임상 작업을 위해 다차원 기준과 함께 5.3k 합성 멀티 턴 시나리오를 활용합니다.
저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문을 사용하여 진단 정확도를 목표로 하고, 다차원 기준이 있는 5.3k개의 생성 시나리오를 통해 다중 턴 임상 상호작용을 다룹니다.
저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다.
Microsoft Research는 두 개의 보완적 모델을 결합하여 고품질 합성 경로를 제안하는 새로운 역합성 예측 프레임워크인 RetroChimera를 출판하고 오픈소스로 공개했습니다. 이 시스템은 학습된 앙상블 전략을 사용하여 R-SMILES 2(Transformer 기반의 de-novo 모델)와 NeuralLoc(GNN 기반 모델)을 통합하고 예측을 순위 매깁니다.
저자는 두 명제 간의 모순을 감지하는 추론 시스템의 연구 설계를 제안합니다. 이는 직접적인 LLM 판단에 의존하는 대신, 명제를 더 작은 구성 요소로 분해하고 논리적 충돌을 검색함으로써 수행됩니다.
연구자들은 오픈소스 코드베이스에 구현된 기능을 사용하여 소스 코드를 유일한 입력으로 강화학습 환경을 구축하는 에이전트 파이프라인인 CodeMidas를 소개했습니다. 이 방법은 기능 탐색, 실행 기반 테스트 구축, 반복 롤아웃을 통한 작업 검증을 위해 에이전트 컴퓨팅을 할당하며, 그 결과 23개 프로그래밍 언어에 걸쳐 5,545개의 학습 작업 데이터셋이 생성됩니다. GRPO를 사용하여 이러한 작업에서 MiMo-V2.5를 훈련하면 DeepSWE (+11.7%), ProgramBench (+17%), Terminal-Bench v2.1 (+8.5%) 등 다양한 벤치마크에서 성능이 향상됩니다. 궤적 분석에 따르면 RL로 훈련된 에이전트는 코드베이스 탐색 증가 및 더 다양한 자기 검증과 같은 더 나은 행동을 보이는 것으로 나타났습니다. 이러한 결과는 소스 코드가 다양한 소프트웨어 작업에서 코딩 에이전트를 개선하는 RL 환경을 구축하기 위한 확장 가능한 기반임을 입증합니다.
연구자들은 임상 개발 계획(CDP)을 지원하기 위해 설계된 메모리 증강 다중 에이전트 연구 조직인 TrialAtlas를 소개했습니다. 이 시스템은 문헌 합성, 경쟁 정보 및 규제 분석을 위한 전문 에이전트를 조정하여 개발 위험을 예측합니다.
MB-Bidram은 추론 능력과 지식 저장을 분리하도록 설계된 WideNDepth(WND)라는 실험용 신경망 아키텍처를 출시했습니다. 이 모델은 메모리 역할을 하는 'Wide 부분'과 추론자 역할을 하는 'Depth 부분'으로 구성됩니다.
한 연구자는 판독자 간 낮은 일치율이 과제의 해석적 성격에서 비롯된 것인지, 아니면 모호한 주석 정의에서 비롯된 것인지를 파악하기 위해 100개의 터키어 내러티브 장면을 라벨링할 독립적인 인간 주석 작성자 한 명을 요청하고 있습니다. 연구 결과, 네 개의 LLM과 규칙 기반 검출기가 서로 그리고 인간 기준과 약간의 수준으로 일치했으며, Cohen’s κ 점수는 0.000에서 0.185 사이였습니다.
독립 연구자 Mohamed Menasy는 연속 혈당 모니터링기 데이터로부터 5개 클래스, 15분 단위 혈당 경향을 예측하기 위한 엔드투엔드 디바이스 내 머신러닝 파이프라인을 상세히 설명하는 GlucoEdge를 출판했습니다. 이 작업은 단 2,909개의 파라미터만 포함하는 컴팩트한 1D CNN을 소개하며 PyTorch에서 LiteRT로의 변환까지 전체 워크플로우를 다룹니다.
Hugging Face 포럼의 한 사용자가 점진적 지식 전이에 대한 실험을 제안합니다. 이는 고정 크기의 학생 모델(Qwen 4B)이 가장 큰 사용 가능한 모델에서 직접 학습하는 대신, 점점 더 큰 교사 모델로부터 순차적으로 학습하는 방식입니다.
독립 연구자가 양자화, 가지치기, 증류 등의 모델 압축 기법이 실제로 측정된 에너지 소비를 줄이는지 아니면 단순히 FLOPs 만 낮추는지 분석하는 문헌 검토를 발표했습니다.
본 기사에서는 제약 인식 조합 계획을 활용하는 인간에서 로봇으로의 전달 방법인 Human2Any를 소개합니다. 출처에는 추가 세부 사항이나 본문 텍스트가 제공되지 않았습니다.
OpenAI는 학습 중 모든 연산이 이종 상용 하드웨어에서 비트 단위의 정확도로 독립적으로 재현 가능한 체계 하에 훈련된 언어 모델인 Open-1B를 출시했습니다. 이 접근 방식은 GPU 커널 축소 및 데이터 배치 순서화와 같은 비결정론적 원인에 명확한 순서를 부과함으로써 오픈소스 모델에 내재된 재현성 문제를 해결합니다.
Atria Dawn Preview는 도구 매개 상호작용을 실행 가능 환경에 연결하는 검증 가능한 경험 파이프라인을 통해 학습된 과학 연구 및 엔지니어링 워크플로우를 위해 설계된 기반 에이전트 언어 모델입니다. 실제 연구, 엔지니어링 및 디지털 작업을 아우르는 16개 벤치마크에서 이 모델은 최첨단 에이전트들과 경쟁력 있으며, 그중 5개에서 최고 보고 점수를 달성했습니다.