주제 · Training methods
lab Microsoft Research Blog · 방금 실시간

마이크로소프트 리서치 시스템이 미국 66,935개 변전소의 우주 기상 위험을 예측

마이크로소프트 리서치에서 개발한 머신러닝 파이프라인은 미국 본토의 66,935개 변전소에 대해 위치별 자기유도전류(GIC) 위험 추정치를 생성합니다. 이 시스템은 태양풍 예보와 지역 지질 데이터를 결합하여 특정 위험이 나타나기 전 30~60분의 사전 경고를 전력망 운영자에게 제공합니다.

arxiv arXiv cs.CL · 17시간 전 · 조회수 1회

컨텍스트 언어 모델은 컨텍스트를 편집 가능한 파일로 네이티브하게 관리합니다

연구자들은 컨텍스트 언어 모델(CLMs)을 소개했는데, 이는 모델의 컨텍스트 창을 편집 가능한 파일로 취급하여 모델이 자신의 메모리에 제한 없이 업데이트할 수 있도록 하는 새로운 아키텍처입니다. 이 접근 방식은 컨텍스트 관리를 외부 하네시 제어에서 모델의 내재적 행동으로 전환하여, 컨텍스트 내 학습과 매개변수 학습 모두를 통해 컨텍스트 관리 전략을 가능하게 합니다.

arxiv arXiv cs.CL · 2일 전 SWE-bench Verified · 49.2% · 조회수 1회

ROFT는 자체 생성 설명에 대한 파인튜닝으로 에이전트 모델을 개선합니다

연구자들은 Retrospection-Only Fine-Tuning (ROFT)를 조사하고 있습니다. 이는 에이전트가 자신의 경험에 대한 회고적 설명을 생성하고 해당 설명 토큰의 다음 토큰 예측 손실만을 사용하여 파인튜닝되는 최소한의 온라인 절차입니다. 이 방법에는 외부 교사나 보상 기반 정책 업데이트가 필요하지 않습니다.

arxiv arXiv cs.CL · 7일 전 · 조회수 8회

VHD-Play는 해결된 메커니즘에서 에이전트형 RL 환경을 생성합니다

VHD-Play는 수학적 모델을 샘플링하고 해결한 후 의사결정 과정을 상태 유지 도구로 렌더링하여 다양한 에이전트형 강화학습 환경을 생성하는 파이프라인입니다. 이 접근 방식은 실행 가능한 동역학과 궤적 평가 기준이 해결된 모델에서 직접 상속되도록 하여 기존 생성 파이프라인에서 흔히 발생하는 정렬 문제를 해결합니다.

arxiv arXiv cs.CL · 7일 전 SWE-Lancer · 51.47% · 조회수 10회

SkillGym이 LLM에 인간 기술을 내재화하여 현실 문제 해결을 가능하게 함

연구진은 SkillGym을 소개합니다. 이는 인간이 작성한 에이전트 기술을 대형 언어 모델 에이전트를 위한 실행 가능하고 검증 가능한 학습 환경으로 변환하는 프레임워크입니다. 이 시스템은 기술-작업 파이프라인을 활용하여 구체적인 작업을 인스턴스화하고 코드 기반 체크기로 결과를 검증합니다.

lab Hugging Face Blog · 7일 전 · 조회수 16회

NVIDIA Warp와 MjWarp가 GPU 가속 병렬 로봇 시뮬레이션 가능

NVIDIA Warp를 기반으로 구축된 MuJoCo Warp(MJWarp)는 호환되는 MuJoCo 모델을 GPU 규모로 실행하여 단일 호출 수백 또는 수천 개의 독립적인 시뮬레이션 환경을 확장할 수 있게 합니다. 이 아키텍처는 단일 환경의 지연 시간 최소화에서 집계 처리량 개선으로 초점을 전환하며, 이는 강화 학습과 대규모 샘플링에 유리합니다.

arxiv arXiv cs.AI · 8일 전 · 조회수 17회

월드 상태 생성기는 에이전트 성공을 높이기 위해 계획을 합성 세계와 정렬합니다

월드 상태 생성기(WSG)는 실패 후 상태를 재작성하여 언어 에이전트의 계획이 실행 환경의 규칙과 일치하도록 유지하는 모델입니다. 이는 규칙을 강제하고 목표 도달 가능성을 검증하는 프로그램이 있는 7개의 합성 도메인에서 추출된 226K 트래젝토리에서 훈련되었습니다.

arxiv arXiv cs.LG · 9일 전 HealthBench · 50.1% · 조회수 13회

Fathom-Vaidya, 기준 기반 보상으로 의료 추론 개선

저자들은 진단 및 임상 의료 추론을 향상시키기 위해 합성 데이터와 기준 기반 강화 학습을 사용하는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문들에 규칙 유도 RL을 적용한 후, 상호작용 임상 작업을 위해 다차원 기준과 함께 5.3k 합성 멀티 턴 시나리오를 활용합니다.

arxiv arXiv cs.AI · 9일 전 HealthBench · 50.1% · 조회수 16회

Fathom-Vaidya, 기준 기반 보상을 통해 의료 추론 개선

저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문을 사용하여 진단 정확도를 목표로 하고, 다차원 기준이 있는 5.3k개의 생성 시나리오를 통해 다중 턴 임상 상호작용을 다룹니다.

media Latent Space · 9일 전 · 조회수 22회

TypeSafe AI, 교정된 결정을 위한 강화학습으로 훈련된 System One 모델 Jev 발표

TypeSafe AI는 프로덕션 환경을 위해 설계된 새로운 클래스의 "System One" 모델인 Jev를 출시했습니다. 동사의 CEO이자 InstructGPT 논문의 공동 저자인 Diogo Almeida는 현재 최전방 모델들이 신뢰성보다 정렬과 거부 반응에 우선순위를 두어 환각 현상과 아부 같은 문제를 초래했다고 주장합니다.

media MarkTechPost · 13일 전 · 조회수 23회

OpenAI, 모델 불일치 공개 프레임워크를 3가지 검토 트랙과 함께 출시

OpenAI는 강화학습 훈련에서 발생한 6건의 상세한 사고 보고서를 동반하여, 자체 모델의 불일치를 추적, 조사 및 공개하기 위한 새로운 프레임워크를 도입했습니다. 이 시스템은 행동이 완전히 설명되거나 완화되지 않은 경우에도 적용되며, 공개를 위한 구체적인 기준과 마감일을 설정합니다.