주제 · Training methods
lab NVIDIA Research · 3일 전 · 조회수 38회

LLM이 하이퍼파라미터 최적화에서 베이지안 최적화와 동등하거나 이를 능가함

새로운 논문은 제한된 예산 설정에서 일반적으로 수동 접근 방식에 의존하는 프로세스인 하이퍼파라미터 최적화(HPO)를 자동화하기 위해 기초 대규모 언어 모델(LLM)을 사용하는 것을 탐구합니다. 저자들은 데이터셋 및 모델 설명에 기반하여 LLM이 하이퍼파라미터 구성을 제안하고, 이를 모델 성능에 따라 반복적으로 정제하는 방법론을 개발했습니다.

lab NVIDIA Research · 3일 전 · 조회수 40회

Source가 훈련 데이터 속성 추정을 위한 근사 언롤링 미분 도입

연구자들은 영향 함수의 계산 효율성과 언롤링 기반 접근법의 정확성을 결합한 새로운 훈련 데이터 속성 추정(TDA) 방법인 Source를 소개합니다. 영향 함수와 유사한 공식을 사용하여 언롤링 미분을 근사함으로써, Source는 최적화 편향이나 다단계 파이프라인을 고려하지 않는다는 암시적 미분 방법의 한계를 해결합니다.

lab NVIDIA Research · 3일 전 · 조회수 12회

jlorraine, 딥러닝을 위한 확장 가능한 중첩 최적화 도구 발표

본 기사는 대규모 딥러닝 설정에 이중 수준 또는 중첩 최적화를 적용하는 과제를 다루는 jlorraine 의 논문을 소개합니다. 그래디언트 기반 최적화는 일반적으로 단일 매개변수 집합을 업데이트하지만, 많은 응용 프로그램에서는 서로 중첩된 다른 목적 함수에 대해 매개변수 부분 집합을 업데이트해야 합니다.

lab NVIDIA Research · 4일 전 · 조회수 9회

ZPPO는 작은 비전-언어 모델 학습을 개선하기 위해 그래디언트 대신 프롬프트를 사용한다

연구자들은 지식 증류의 취약성과 강화학습에서의 드리프트(drift) 문제를 해결하기 위해 정책 그래디언트가 아닌 프롬프트에 교사 지식을 주입하는 방법인 근접 정책 최적화 영역(Zone of Proximal Policy Optimization, ZPPO)을 소개한다. ZPPO는 어려운 질문에 대해 이진 후보 포함 질문(Binary Candidate-included Questions, BCQ)과 부정 후보 포함 질문(Negative Candidate-included Questions, NCQ)을 구성하고, 학생의 정확도가 향상되거나 제외될 때까지 리플레이 버퍼를 통해 이를 순환시킨다.

lab Microsoft Research Blog · 15일 전 · 조회수 4회

Microsoft Research, 진화하는 라이브러리를 활용한 테스트 타임 학습을 위한 EvoLib 소개

Microsoft Research는 추론 중 정답 레이블이나 외부 피드백 없이도 대규모 언어 모델이 자신의 경험으로부터 학습할 수 있는 프레임워크인 EvoLib를 도입했습니다. EvoLib는 원시 경험을 정적 메모리로 저장하는 대신, 지속적으로 정제되고 통합되며 재가중되는 재사용 가능한 기술과 반성적 통찰력으로 변환합니다.

media Hugging Face Forums · 1일 전 · 조회수 1회

ThetaMem은 고정 상태 시퀀스 메모리를 위해 부호 있는 승법 키 리프트를 제안합니다

ThetaMem은 재귀적 혼합기(recurrent mixer)에 대한 초기 단일 시드 연구로, 게이트 메커니즘을 정교화하는 대신 학습된 부호 있는 하다마르 또는 외적(key lifts)을 통해 재귀 상태를 수정합니다. 저자는 합성 벤치마크에서 혼합된 결과를 제시하며, 접근 방식을 반증할 수 있는 가장 저렴한 실험을 식별하기 위해 비판을 명시적으로 구합니다.

media MarkTechPost · 1일 전 · 조회수 6회

Dyna Robotics가 100만 시간의 인간 영상을 기반으로 사전 학습된 월드 액션 모델 Dyna-2 출시

Dyna Robotics는 시점 인간 영상 100만 시간 이상으로 사전 학습된 로봇 조작용 월드 액션 모델인 Dyna-2를 출시했습니다. 동사는 1,000시간에서 1,000,000시간까지의 스케일링 법칙을 확립함으로써 일반 인간 영상이 액션 레이블 데이터의 대체재가 될 수 있음을 입증했습니다.

arxiv arXiv cs.AI · 3일 전

MiLMMT-46-v1.0, 레퍼런스 없는 사후 학습을 통한 다국어 번역 성능 향상

연구진은 오픈 대규모 언어 모델에 레퍼런스 없는 사후 학습을 적용하는 다국어 기계 번역 모델인 MiLMMT-46-v1.0을 개발했습니다. 연구팀은 언어 식별에 의해 게이트되는 두 개의 레퍼런스 없는 품질 추정 모델을 기반으로 한 보상과 함께 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)를 사용합니다.

arxiv arXiv cs.CL · 3일 전 · 조회수 1회

MiLMMT-46-v1.0, 레퍼런스 없는 사후 학습을 통해 다국어 번역 성능 향상

연구자들이 레퍼런스 없는 사후 학습을 활용하는 다국어 기계 번역용 오픈 대규모 언어 모델인 MiLMMT-46-v1.0을 공개했습니다. 감독 학습 파인튜닝된 MiLMMT-46-v0.1을 기반으로, 연구팀은 언어 식별에 의해 게이트되는 두 개의 레퍼런스 없는 품질 추정 모델을 기반으로 한 보상과 함께 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)를 적용했습니다.

lab Hugging Face Blog · 5일 전 · 조회수 8회

멀티버스 컴퓨팅이 융합 청크형 KL 손실로 지식 증류 VRAM을 절감

멀티버스 컴퓨팅은 오프라인 top-K 로짓 캐싱과 융합 청크형 켈러백-라이블러(KL) 발산 손실을 결합하여 대규모 언어 모델 지식 증류를 위한 메모리 효율적인 접근 방식을 소개합니다. 이 방법은 교사와 학생 모델을 동시에 메모리에 유지할 필요성을 제거하여 VRAM 요구 사항을 대폭 줄입니다.

arxiv arXiv cs.LG · 8일 전

U-OPSD는 LLM을 위한 비지도 온-폴리시 자기 증류(Self-Distillation)를 가능하게 한다

연구자들은 외부 감독 없이 모델의 자체 생성만 사용하여 대규모 언어 모델(LLM)의 사후 학습 성능을 향상시키는 방법인 비지도 온-폴리시 자기 증류(Unsupervised On-Policy Self-Distillation, U-OPSD)를 제안한다. 이 접근법은 다중 롤아웃을 샘플링하여 과반수 투표를 통해 의사 정답(pseudo-solution)을 구성한 후, 모델의 가장 긴 오답 완료 구문의 접두사 부분에 교사 분포를 증류(distill)한다.

media r/LocalLLaMA · 11일 전 · 조회수 5회

Apple의 AFM3 20B는 명령 따르기 가지치기를 사용하여 ~20%의 레이어를 활성화합니다

Apple은 제3세대 파운데이션 모델(AFAM3)을 위한 새로운 아키텍처를 도입하여 "명령 따르기 가지치기"를 활용하여 활성 매개변수 수를 크게 줄였습니다. 이 모델은 토큰마다가 아닌 프롬프트당 한 번 라우팅 결정을 내림으로써 MLP 레이어의 약 20%를 활성화하도록 설계되었습니다.

media MarkTechPost · 12일 전 · 조회수 4회

NVIDIA NeMo가 Molt 출시: PyT-native 기반의 경량 에이전트 RL 프레임워크

NVIDIA의 NeMo 팀은 연구자들의 알고리즘 반복 작업을 단순화하기 위해 설계된 오픈소스 에이전트 강화 학습 프레임워크인 Molt를 출시했습니다. 이 코드베이스는 약 8.6K 줄의 RL 코드로 구성되어 있으며, verl(62K 줄)과 slime(25K 줄)과 같은 유사한 프레임워크에 비해 훨씬 작습니다.

media Hugging Face Forums · 13일 전

실패한 에이전트 트레이스를 파인튜닝 데이터로 사용할 수 있는지 조사

저자는 잘못된 도구 선택이나 비정상적인 인수와 같은 실패한 도구 사용 에이전트 트레이스가 이러한 오류로부터 모델을 학습시키는 데 가치 있는 파인튜닝 데이터가 될 수 있다는 가설을 제시합니다. 이 게시물은 수정된 실패 트레이스에서의 학습이 효과적인지 해로운지에 대한 커뮤니티 피드백을 구합니다.