SplitMoE는 매개변수 중복을 줄이기 위해 세분화된 전문가 라우팅을 도입합니다
SplitMoE는 토큰 표현의 유연성과 계산 모듈성을 개선하기 위해 넓은 피드포워드 레이어를 더 작고 전문적인 하위 구성 요소로 분해하는 대체 Mixture of Experts 아키텍처입니다.
SplitMoE는 토큰 표현의 유연성과 계산 모듈성을 개선하기 위해 넓은 피드포워드 레이어를 더 작고 전문적인 하위 구성 요소로 분해하는 대체 Mixture of Experts 아키텍처입니다.
월드 상태 생성기(WSG)는 실패 후 상태를 재작성하여 언어 에이전트의 계획이 실행 환경의 규칙과 일치하도록 유지하는 모델입니다. 이는 규칙을 강제하고 목표 도달 가능성을 검증하는 프로그램이 있는 7개의 합성 도메인에서 추출된 226K 트래젝토리에서 훈련되었습니다.
저자들은 진단 및 임상 의료 추론을 향상시키기 위해 합성 데이터와 기준 기반 강화 학습을 사용하는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문들에 규칙 유도 RL을 적용한 후, 상호작용 임상 작업을 위해 다차원 기준과 함께 5.3k 합성 멀티 턴 시나리오를 활용합니다.
Jen Wei는 다가오는 PyTorch Conference 발표를 위해 OLMo-core 내에서 AdamW, Muon 및 최신 Dion3 구현을 테스트하는 동안 학습률 데스 스피럴에 직면했습니다.
저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문을 사용하여 진단 정확도를 목표로 하고, 다차원 기준이 있는 5.3k개의 생성 시나리오를 통해 다중 턴 임상 상호작용을 다룹니다.
저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다.
TypeSafe AI는 프로덕션 환경을 위해 설계된 새로운 클래스의 "System One" 모델인 Jev를 출시했습니다. 동사의 CEO이자 InstructGPT 논문의 공동 저자인 Diogo Almeida는 현재 최전방 모델들이 신뢰성보다 정렬과 거부 반응에 우선순위를 두어 환각 현상과 아부 같은 문제를 초래했다고 주장합니다.
MB-Bidram은 추론 능력과 지식 저장을 분리하도록 설계된 WideNDepth(WND)라는 실험용 신경망 아키텍처를 출시했습니다. 이 모델은 메모리 역할을 하는 'Wide 부분'과 추론자 역할을 하는 'Depth 부분'으로 구성됩니다.
Hugging Face의 제안은 AI의 두 가지 상호 연결된 문제를 논의합니다: 개별 대형 모델을 훈련하는 의존성과 생태계의 범용 GPU에 대한 의존성.
Hugging Face 포럼의 한 사용자가 점진적 지식 전이에 대한 실험을 제안합니다. 이는 고정 크기의 학생 모델(Qwen 4B)이 가장 큰 사용 가능한 모델에서 직접 학습하는 대신, 점점 더 큰 교사 모델로부터 순차적으로 학습하는 방식입니다.
OpenAI는 강화학습 훈련에서 발생한 6건의 상세한 사고 보고서를 동반하여, 자체 모델의 불일치를 추적, 조사 및 공개하기 위한 새로운 프레임워크를 도입했습니다. 이 시스템은 행동이 완전히 설명되거나 완화되지 않은 경우에도 적용되며, 공개를 위한 구체적인 기준과 마감일을 설정합니다.
ByteLex 연구원들은 11개 토크나이저 어휘에서 좌표 공간을 구축하여 바이트 레벨 언어 모델이 어떤 가상의 단어에서 실패할지 예측했습니다. 이 맵은 모델의 측정된 단어별 정확도와 -0.98의 스피어만 상관을 달성하여 코퍼스 기반 통계를 능가했습니다.
OpenAI는 학습 중 모든 연산이 이종 상용 하드웨어에서 비트 단위의 정확도로 독립적으로 재현 가능한 체계 하에 훈련된 언어 모델인 Open-1B를 출시했습니다. 이 접근 방식은 GPU 커널 축소 및 데이터 배치 순서화와 같은 비결정론적 원인에 명확한 순서를 부과함으로써 오픈소스 모델에 내재된 재현성 문제를 해결합니다.
TRL v1.14는 AsyncGRPOTrainer에 LoRA 지원을 도입하여 Low-Rank Adaptation 어댑터를 학습하고 해당 작은 파일만 vLLM 추론 작업자에 동기화할 수 있게 합니다. 이 아키텍처는 공유 스토리지 버킷을 파일 시스템 브릿지로 사용하여 별도의 머신에서 학습 및 생성 작업을 분리함으로써 노드 간 NCCL 또는 직접 네트워크 통신의 필요성을 제거합니다.
사용자 pop123-ux 는 고급 추상화를 단계적으로 제거하여 Hugging Face 스택을 이해하는 데 도움이 되도록 설계된 38 개의 실행 가능한 노트북이 포함된 학습 저장소를 게시했습니다. 이 컬렉션은 transformers 및 tokenizers 와 같은 핵심 구성 요소부터 파인튜닝, PEFT, 추론/RL 및 엔드투엔드 프로젝트 작업에 이르는 경로를 다룹니다.
Together AI는 GLM-5.3과 Kimi K2.7을 포함한 더 넓은 범위의 오픈 가중치 모델을 지원하기 위해 파인튜닝 서비스를 확장했으며, 훈련 과정에 대한 실시간 실험 추적 및 세밀한 제어 기능을 도입했습니다.
Google 및 여러 일본 대학의 연구자들은 ToolGrad를 소개했으며, 이는 검증된 API 체인을 먼저 구성한 후 일치하는 사용자 쿼리를 작성함으로써 기존 도구 사용 데이터셋 생성 파이프라인을 역전시키는 프레임워크입니다. 이 접근 방식은 에이전트 탐색 중 자주 실패하는 쿼리 우선 방식의 비효율성을 제거하는 것을 목표로 합니다.
연구자들은 테스트-검증-수정 스캐폴드와 역할별 강화 학습을 결합하여 코딩 에이전트를 향상시키는 프레임워크인 ExecCritic을 소개했다. 이 시스템은 테스트 구축과 소스 코드 수리를 분리하며, Test 에이전트는 저장소 네이티브 테스트를 생성하고 Repair 에이전트는 실행 피드백을 기반으로 코드를 수정한다.
memaudit는 프라이빗 데이터로 모델을 파인튜닝하는 과정에서 암기가 발생했는지 확인하기 위해 TRL 라이브러리와 통합되는 도구입니다. 이 도구는 데이터셋에 보정된 미키 시크릿을 주입하고 학습 과정 중 손실을 모니터링하여 작동합니다.
데모는 가이드 텍스트에서 키-값 (KV) 상태를 고정하면 Qwen2.5-3B-Instruct 모델이 라이브 프롬프트에 가이드를 포함하지 않고도 새 지침을 적용할 수 있음을 보여줍니다. 이 방법은 모델을 통해 가이드를 한 번 실행하고, 그 KV 캐시를 고정한 다음, 해당 숨겨진 접두사 위에서 응답을 생성하는 것을 포함합니다.