Research paper
arxiv arXiv cs.AI · 2시간 전 · 조회수 9회

AIDE^2가 AI 연구 에이전트의 재귀적 자기 개선 가능

연구원들은 AIDE^2를 제시했으며, 이는 자체 코드를 최적화하여 AI 연구 에이전트에 대한 재귀적 자기 개선 루프를 구현하는 시스템입니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, 수정된 버전을 AI R&D 작업에서 벤치마킹하며, 숨겨진 평가에서 가장 잘 수행되는 개선 사항만 유지합니다.

arxiv arXiv cs.AI · 3시간 전 WebArena · 45.3% · 조회수 13회

Growing Harness는 실패 기반 학습을 통해 재귀적 에이전트 제어를 재사용 가능한 코드로 전환합니다

저자들은 Growing Harness를 소개합니다. 이는 표준적인 컨텍스트 중심의 하네스에 의존하는 대신 작업 피드백으로부터 에이전트의 제어 구조를 학습하는 훈련 패러다임입니다. 반복되는 제어 결정을 실행 가능한 코드로 변환하고 LLM 호출은 의미론적 추론에 할당함으로써, 이 방법은 재사용 가능한 전문 에이전트를 만드는 것을 목표로 합니다.

arxiv arXiv cs.LG · 4시간 전 · 조회수 11회

AIDE^2는 AI 연구 에이전트의 재귀적 자기 개선 기능을 가능하게 합니다

연구자들은 최첨단 AI 연구 에이전트의 자체 코드를 최적화하여 재귀적 자기 개선 루프를 구현하는 시스템인 AIDE^2를 제시했습니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, AI R&D 작업에서 수정된 버전을 벤치마킹하며, 숨겨진 평가에서 가장 우수한 성능을 보이는 업데이트만 유지합니다.

arxiv arXiv cs.CL · 7시간 전 · 조회수 11회

TelecomGPT-R1: 이종 Telecom 작업 전반의 추론을 위한 통합 사후 학습

연구자들은 표준, 구성 및 로그에 대한 추론을 통해 엔지니어링 작업을 자동화하도록 설계된 오픈소스 통합 telecom 추론 모델 패밀리인 TelecomGPT-R1을 소개합니다. 이 모델은 프로토콜, 지식, 모델링, 결함 축을 아우르는 구조화된 접근 방식을 통해 기존 범용 및 전문 LLM의 한계를 극복합니다.

arxiv arXiv cs.LG · 1일 전 HealthBench · 50.1% · 조회수 10회

Fathom-Vaidya, 기준 기반 보상으로 의료 추론 개선

저자들은 진단 및 임상 의료 추론을 향상시키기 위해 합성 데이터와 기준 기반 강화 학습을 사용하는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문들에 규칙 유도 RL을 적용한 후, 상호작용 임상 작업을 위해 다차원 기준과 함께 5.3k 합성 멀티 턴 시나리오를 활용합니다.

arxiv arXiv cs.AI · 1일 전 HealthBench · 50.1% · 조회수 12회

Fathom-Vaidya, 기준 기반 보상을 통해 의료 추론 개선

저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문을 사용하여 진단 정확도를 목표로 하고, 다차원 기준이 있는 5.3k개의 생성 시나리오를 통해 다중 턴 임상 상호작용을 다룹니다.

lab Microsoft Research Blog · 2일 전 · 조회수 29회

Microsoft가 역합성 예측을 위한 RetroChimera를 출시하다

Microsoft Research는 두 개의 보완적 모델을 결합하여 고품질 합성 경로를 제안하는 새로운 역합성 예측 프레임워크인 RetroChimera를 출판하고 오픈소스로 공개했습니다. 이 시스템은 학습된 앙상블 전략을 사용하여 R-SMILES 2(Transformer 기반의 de-novo 모델)와 NeuralLoc(GNN 기반 모델)을 통합하고 예측을 순위 매깁니다.

arxiv arXiv cs.AI · 2일 전 · 조회수 18회

CodeMidas는 소스 코드를 사용하여 에이전트 코딩 RL 환경을 확장합니다

연구자들은 오픈소스 코드베이스에 구현된 기능을 사용하여 소스 코드를 유일한 입력으로 강화학습 환경을 구축하는 에이전트 파이프라인인 CodeMidas를 소개했습니다. 이 방법은 기능 탐색, 실행 기반 테스트 구축, 반복 롤아웃을 통한 작업 검증을 위해 에이전트 컴퓨팅을 할당하며, 그 결과 23개 프로그래밍 언어에 걸쳐 5,545개의 학습 작업 데이터셋이 생성됩니다. GRPO를 사용하여 이러한 작업에서 MiMo-V2.5를 훈련하면 DeepSWE (+11.7%), ProgramBench (+17%), Terminal-Bench v2.1 (+8.5%) 등 다양한 벤치마크에서 성능이 향상됩니다. 궤적 분석에 따르면 RL로 훈련된 에이전트는 코드베이스 탐색 증가 및 더 다양한 자기 검증과 같은 더 나은 행동을 보이는 것으로 나타났습니다. 이러한 결과는 소스 코드가 다양한 소프트웨어 작업에서 코딩 에이전트를 개선하는 RL 환경을 구축하기 위한 확장 가능한 기반임을 입증합니다.

media Hugging Face Forums · 3일 전 · 조회수 16회

연구자가 LLM 간 합의 불명확성을 해결하기 위해 독립적인 한 명의 주석 작성자를 구함

한 연구자는 판독자 간 낮은 일치율이 과제의 해석적 성격에서 비롯된 것인지, 아니면 모호한 주석 정의에서 비롯된 것인지를 파악하기 위해 100개의 터키어 내러티브 장면을 라벨링할 독립적인 인간 주석 작성자 한 명을 요청하고 있습니다. 연구 결과, 네 개의 LLM과 규칙 기반 검출기가 서로 그리고 인간 기준과 약간의 수준으로 일치했으며, Cohen’s κ 점수는 0.000에서 0.185 사이였습니다.

media Hugging Face Forums · 3일 전 · 조회수 17회

GlucoEdge: INT8 양자화를 통한 디바이스 내 혈당 경향 예측

독립 연구자 Mohamed Menasy는 연속 혈당 모니터링기 데이터로부터 5개 클래스, 15분 단위 혈당 경향을 예측하기 위한 엔드투엔드 디바이스 내 머신러닝 파이프라인을 상세히 설명하는 GlucoEdge를 출판했습니다. 이 작업은 단 2,909개의 파라미터만 포함하는 컴팩트한 1D CNN을 소개하며 PyTorch에서 LiteRT로의 변환까지 전체 워크플로우를 다룹니다.

arxiv arXiv cs.LG · 7일 전 · 조회수 20회

OpenAI, 완전히 감사 가능한 학습 실행으로 Open-1B 출시

OpenAI는 학습 중 모든 연산이 이종 상용 하드웨어에서 비트 단위의 정확도로 독립적으로 재현 가능한 체계 하에 훈련된 언어 모델인 Open-1B를 출시했습니다. 이 접근 방식은 GPU 커널 축소 및 데이터 배치 순서화와 같은 비결정론적 원인에 명확한 순서를 부과함으로써 오픈소스 모델에 내재된 재현성 문제를 해결합니다.

arxiv arXiv cs.AI · 8일 전 · 조회수 24회

Atria Dawn 미리보기: 과학 연구를 위한 기반 에이전트 언어 모델

Atria Dawn Preview는 도구 매개 상호작용을 실행 가능 환경에 연결하는 검증 가능한 경험 파이프라인을 통해 학습된 과학 연구 및 엔지니어링 워크플로우를 위해 설계된 기반 에이전트 언어 모델입니다. 실제 연구, 엔지니어링 및 디지털 작업을 아우르는 16개 벤치마크에서 이 모델은 최첨단 에이전트들과 경쟁력 있으며, 그중 5개에서 최고 보고 점수를 달성했습니다.