Training methods
arxiv arXiv cs.LG · 2일 전

U-OPSD는 LLM을 위한 비지도 온-폴리시 자기 증류(Self-Distillation)를 가능하게 한다

연구자들은 외부 감독 없이 모델의 자체 생성만 사용하여 대규모 언어 모델(LLM)의 사후 학습 성능을 향상시키는 방법인 비지도 온-폴리시 자기 증류(Unsupervised On-Policy Self-Distillation, U-OPSD)를 제안한다. 이 접근법은 다중 롤아웃을 샘플링하여 과반수 투표를 통해 의사 정답(pseudo-solution)을 구성한 후, 모델의 가장 긴 오답 완료 구문의 접두사 부분에 교사 분포를 증류(distill)한다.

media r/LocalLLaMA · 5일 전

Apple의 AFM3 20B는 명령 따르기 가지치기를 사용하여 ~20%의 레이어를 활성화합니다

Apple은 제3세대 파운데이션 모델(AFAM3)을 위한 새로운 아키텍처를 도입하여 "명령 따르기 가지치기"를 활용하여 활성 매개변수 수를 크게 줄였습니다. 이 모델은 토큰마다가 아닌 프롬프트당 한 번 라우팅 결정을 내림으로써 MLP 레이어의 약 20%를 활성화하도록 설계되었습니다.

media MarkTechPost · 7일 전 · 조회수 4회

NVIDIA NeMo가 Molt 출시: PyT-native 기반의 경량 에이전트 RL 프레임워크

NVIDIA의 NeMo 팀은 연구자들의 알고리즘 반복 작업을 단순화하기 위해 설계된 오픈소스 에이전트 강화 학습 프레임워크인 Molt를 출시했습니다. 이 코드베이스는 약 8.6K 줄의 RL 코드로 구성되어 있으며, verl(62K 줄)과 slime(25K 줄)과 같은 유사한 프레임워크에 비해 훨씬 작습니다.

media Hugging Face Forums · 8일 전

실패한 에이전트 트레이스를 파인튜닝 데이터로 사용할 수 있는지 조사

저자는 잘못된 도구 선택이나 비정상적인 인수와 같은 실패한 도구 사용 에이전트 트레이스가 이러한 오류로부터 모델을 학습시키는 데 가치 있는 파인튜닝 데이터가 될 수 있다는 가설을 제시합니다. 이 게시물은 수정된 실패 트레이스에서의 학습이 효과적인지 해로운지에 대한 커뮤니티 피드백을 구합니다.

arxiv arXiv cs.CL · 9일 전 · 조회수 2회

대규모 메모리 디코더: 매개변수형 장기 메모리를 6.9B 파라미터로 확장

연구자들은 매개변수형 장기 메모리 모델을 6.9B 파라미터까지 확장하고 300B 토큰으로 사전 훈련하는 시스템인 대규모 Memory Decoder를 제시합니다. 이 데이터 규모에서 표준 Faiss 파이프라인의 실행 불가능성을 해결하기 위해, 저자들은 kNN 분포의 희소 및 배치별 로딩을 사용하는 분산 인덱싱 파이프라인을 구현했습니다.

lab Microsoft Research Blog · 9일 전 · 조회수 3회

Microsoft Research, 진화하는 라이브러리를 활용한 테스트 타임 학습을 위한 EvoLib 소개

Microsoft Research는 추론 중 정답 레이블이나 외부 피드백 없이도 대규모 언어 모델이 자신의 경험으로부터 학습할 수 있는 프레임워크인 EvoLib를 도입했습니다. EvoLib는 원시 경험을 정적 메모리로 저장하는 대신, 지속적으로 정제되고 통합되며 재가중되는 재사용 가능한 기술과 반성적 통찰력으로 변환합니다.

arxiv arXiv cs.CL · 11일 전

Relay-OPD는 온파시얼리 디스틸레이션에서 학습 궤적 길이를 50% 이상 단축합니다

연구자들은 표준 온파시얼리 디스틸레이션에서 학생의 오류가 신뢰할 수 없는 감독을 초래하는 접두사 실패 문제를 해결하기 위해 Relay On-Policy Distillation (Relay-OPD)를 소개했습니다. 이 방법은 교사-학생 연속성 비대칭을 트리거로 사용하여, 학생이 재개하기 전에 교사가 잠시 개입하여 궤적을 재지시합니다.

arxiv arXiv cs.CL · 13일 전 OSWorld · 37.7%

OpenForgeRL은 모든 환경에서 하네스 기반 에이전트의 엔드투엔드 학습을 가능하게 합니다

OpenForgeRL은 연구자들이 표준 강화학습 스택을 사용하여 하네스 기반 AI 에이전트를 엔드투엔드로 학습할 수 있게 하는 오픈소스 프레임워크입니다. 이는 경량 프록시를 통해 모델 호출을 데이터로 기록하고, 쿠버네티스 오케스트레이터를 사용하여 원격 컨테이너에서 롤아웃을 관리함으로써 학습과 추론을 분리합니다.

media Hugging Face Forums · 14일 전 GSM8K · 74.22%

CrowdTensor, 자원봉사자 교육 베타 및 Qwen2.5-7B GSM8K 캠페인 초안 RFC 출시

CrowdTensor는 체크포인트된 자원봉사자 모델 학습 캠페인을 위한 Apache-2.0 오픈소스 프로토콜로, 승인된 CPU, GPU 또는 TPU 셀에 불변의 모델 및 데이터 리비전을 고정하여 제한된 작업을 제공합니다. 이 프로젝트는 Qwen2.5-7B GSM8K 캠페인을 위한 초안 RFC와 함께 베타 등록 절차를 출시했습니다.

media Hugging Face Forums · 15일 전

ThetaScan v0.1 출시: 17M LM 결과와 함께 오픈 스캔 병렬 비선형 메모리 제공

고정 상태 비선형 토큰 믹서인 ThetaScan v0.1의 연구 미리보기가 오픈소스 구현으로 출시되었습니다. 이 아키텍처는 각 토큰이 진화하는 빠른 상태가 아닌 현재 입력과 공유 매개변수로부터 메모리 쓰기를 계산하도록 보장하여, 쓰기가 결합적 접두사 스캔을 통해 합성되도록 합니다.

arxiv arXiv cs.CL · 16일 전 SWE-bench Pro · 55.9% · 조회수 2회

OpenForgeRL은 모든 환경에서 하니스 기반 에이전트의 엔드투엔드 학습을 가능하게 합니다

연구자들은 Claude Code와 OpenClaw과 같은 복잡한 추론 하arness를 사용하여 AI 에이전트를 엔드투엔드 학습할 수 있는 오픈소스 프레임워크인 OpenForgeRL을 제시했습니다. 이 시스템은 경량 프록시를 통해 모델 호출을 데이터로 기록하고 Kubernetes 오케스트레이터를 사용하여 원격 컨테이너 롤아웃을 관리함으로써 학습과 추론을 분리합니다.

arxiv arXiv cs.AI · 16일 전 OSWorld · 37.7% · 조회수 5회

OpenForgeRL은 모든 환경에서 하네스 기반 에이전트의 엔드투엔드 학습을 가능하게 합니다

OpenForgeRL은 연구자들이 표준 강화학습 스택을 사용하여 하네스 기반 AI 에이전트를 엔드투엔드로 학습할 수 있게 해주는 오픈소스 프레임워크입니다. 이는 모델 호출을 데이터로 기록하는 경량 프록시와 원격 컨테이너 롤아웃을 관리하는 Kubernetes 오케스트레이터를 통해 학습과 추론을 분리함으로써 이를 달성합니다.

media Hugging Face Forums · 17일 전

희소 오토인코더를 사용한 ELIZA

새로운 ELIZA 챗봇 구현은 희소 오토인코더 아키텍처를 활용하여 대화 기록을 잠재적 메모리 레이어에 저장하며, 전통적인 키워드 매칭 방식의 한계를 극복하는 것을 목표로 합니다. 이 시스템은 32,768개의 뉴런으로 구성된 메모리 레이어를 갖춘 T5 인코더-디코더 구조를 사용하며, 대조 학습을 통해 유사한 기록이 활성화됩니다.

arxiv arXiv cs.AI · 17일 전 · 조회수 4회

SLAI의 T-Rex가 Ascend SuperPOD에서 DeepSeek-V4의 전체 파라미터 사후 학습을 가능하게 함

SLAI는 Ascend NPU SuperPOD에서 트릴리언 파라미터 규모의 MoE 모델에 대한 전체 파라미터 사후 학습을 위한 엔드투엔드 최적화 프레임워크인 T-Rex를 소개합니다. DeepSeek-V4 모델 계열을 대상 워크로드로 사용하여, 이 시스템은 계층적 병렬 처리 및 커널 실행 최적화를 통해 메모리 압박과 통신 오버헤드를 해결합니다.