마이크로소프트 리서치 시스템이 미국 66,935개 변전소의 우주 기상 위험을 예측
마이크로소프트 리서치에서 개발한 머신러닝 파이프라인은 미국 본토의 66,935개 변전소에 대해 위치별 자기유도전류(GIC) 위험 추정치를 생성합니다. 이 시스템은 태양풍 예보와 지역 지질 데이터를 결합하여 특정 위험이 나타나기 전 30~60분의 사전 경고를 전력망 운영자에게 제공합니다.
마이크로소프트 리서치에서 개발한 머신러닝 파이프라인은 미국 본토의 66,935개 변전소에 대해 위치별 자기유도전류(GIC) 위험 추정치를 생성합니다. 이 시스템은 태양풍 예보와 지역 지질 데이터를 결합하여 특정 위험이 나타나기 전 30~60분의 사전 경고를 전력망 운영자에게 제공합니다.
연구자들은 컨텍스트 언어 모델(CLMs)을 소개했는데, 이는 모델의 컨텍스트 창을 편집 가능한 파일로 취급하여 모델이 자신의 메모리에 제한 없이 업데이트할 수 있도록 하는 새로운 아키텍처입니다. 이 접근 방식은 컨텍스트 관리를 외부 하네시 제어에서 모델의 내재적 행동으로 전환하여, 컨텍스트 내 학습과 매개변수 학습 모두를 통해 컨텍스트 관리 전략을 가능하게 합니다.
연구자들은 Retrospection-Only Fine-Tuning (ROFT)를 조사하고 있습니다. 이는 에이전트가 자신의 경험에 대한 회고적 설명을 생성하고 해당 설명 토큰의 다음 토큰 예측 손실만을 사용하여 파인튜닝되는 최소한의 온라인 절차입니다. 이 방법에는 외부 교사나 보상 기반 정책 업데이트가 필요하지 않습니다.
로짓 기반 지식 증류에 대한 탐색적 작업을 공유하는 연구자가 커뮤니티로부터 현실 세계의 산업 경험과 엔지니어링 통찰력을 요청하고 있습니다.
VHD-Play는 수학적 모델을 샘플링하고 해결한 후 의사결정 과정을 상태 유지 도구로 렌더링하여 다양한 에이전트형 강화학습 환경을 생성하는 파이프라인입니다. 이 접근 방식은 실행 가능한 동역학과 궤적 평가 기준이 해결된 모델에서 직접 상속되도록 하여 기존 생성 파이프라인에서 흔히 발생하는 정렬 문제를 해결합니다.
연구진은 SkillGym을 소개합니다. 이는 인간이 작성한 에이전트 기술을 대형 언어 모델 에이전트를 위한 실행 가능하고 검증 가능한 학습 환경으로 변환하는 프레임워크입니다. 이 시스템은 기술-작업 파이프라인을 활용하여 구체적인 작업을 인스턴스화하고 코드 기반 체크기로 결과를 검증합니다.
Together AI는 Qwen3.5 4B 기본 모델을 사용하여 Jev와 유사한 분류 모델을 파인튜닝하기 위한 가이드와 오픈소스 저장소를 출시했습니다.
NVIDIA Warp를 기반으로 구축된 MuJoCo Warp(MJWarp)는 호환되는 MuJoCo 모델을 GPU 규모로 실행하여 단일 호출 수백 또는 수천 개의 독립적인 시뮬레이션 환경을 확장할 수 있게 합니다. 이 아키텍처는 단일 환경의 지연 시간 최소화에서 집계 처리량 개선으로 초점을 전환하며, 이는 강화 학습과 대규모 샘플링에 유리합니다.
SplitMoE는 토큰 표현의 유연성과 계산 모듈성을 개선하기 위해 넓은 피드포워드 레이어를 더 작고 전문적인 하위 구성 요소로 분해하는 대체 Mixture of Experts 아키텍처입니다.
월드 상태 생성기(WSG)는 실패 후 상태를 재작성하여 언어 에이전트의 계획이 실행 환경의 규칙과 일치하도록 유지하는 모델입니다. 이는 규칙을 강제하고 목표 도달 가능성을 검증하는 프로그램이 있는 7개의 합성 도메인에서 추출된 226K 트래젝토리에서 훈련되었습니다.
저자들은 진단 및 임상 의료 추론을 향상시키기 위해 합성 데이터와 기준 기반 강화 학습을 사용하는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문들에 규칙 유도 RL을 적용한 후, 상호작용 임상 작업을 위해 다차원 기준과 함께 5.3k 합성 멀티 턴 시나리오를 활용합니다.
Jen Wei는 다가오는 PyTorch Conference 발표를 위해 OLMo-core 내에서 AdamW, Muon 및 최신 Dion3 구현을 테스트하는 동안 학습률 데스 스피럴에 직면했습니다.
저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문을 사용하여 진단 정확도를 목표로 하고, 다차원 기준이 있는 5.3k개의 생성 시나리오를 통해 다중 턴 임상 상호작용을 다룹니다.
저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다.
TypeSafe AI는 프로덕션 환경을 위해 설계된 새로운 클래스의 "System One" 모델인 Jev를 출시했습니다. 동사의 CEO이자 InstructGPT 논문의 공동 저자인 Diogo Almeida는 현재 최전방 모델들이 신뢰성보다 정렬과 거부 반응에 우선순위를 두어 환각 현상과 아부 같은 문제를 초래했다고 주장합니다.
MB-Bidram은 추론 능력과 지식 저장을 분리하도록 설계된 WideNDepth(WND)라는 실험용 신경망 아키텍처를 출시했습니다. 이 모델은 메모리 역할을 하는 'Wide 부분'과 추론자 역할을 하는 'Depth 부분'으로 구성됩니다.
Hugging Face의 제안은 AI의 두 가지 상호 연결된 문제를 논의합니다: 개별 대형 모델을 훈련하는 의존성과 생태계의 범용 GPU에 대한 의존성.
Hugging Face 포럼의 한 사용자가 점진적 지식 전이에 대한 실험을 제안합니다. 이는 고정 크기의 학생 모델(Qwen 4B)이 가장 큰 사용 가능한 모델에서 직접 학습하는 대신, 점점 더 큰 교사 모델로부터 순차적으로 학습하는 방식입니다.
OpenAI는 강화학습 훈련에서 발생한 6건의 상세한 사고 보고서를 동반하여, 자체 모델의 불일치를 추적, 조사 및 공개하기 위한 새로운 프레임워크를 도입했습니다. 이 시스템은 행동이 완전히 설명되거나 완화되지 않은 경우에도 적용되며, 공개를 위한 구체적인 기준과 마감일을 설정합니다.
ByteLex 연구원들은 11개 토크나이저 어휘에서 좌표 공간을 구축하여 바이트 레벨 언어 모델이 어떤 가상의 단어에서 실패할지 예측했습니다. 이 맵은 모델의 측정된 단어별 정확도와 -0.98의 스피어만 상관을 달성하여 코퍼스 기반 통계를 능가했습니다.