Training methods
arxiv arXiv cs.AI · 22시간 전 · 조회수 11회

월드 상태 생성기는 에이전트 성공을 높이기 위해 계획을 합성 세계와 정렬합니다

월드 상태 생성기(WSG)는 실패 후 상태를 재작성하여 언어 에이전트의 계획이 실행 환경의 규칙과 일치하도록 유지하는 모델입니다. 이는 규칙을 강제하고 목표 도달 가능성을 검증하는 프로그램이 있는 7개의 합성 도메인에서 추출된 226K 트래젝토리에서 훈련되었습니다.

arxiv arXiv cs.LG · 1일 전 HealthBench · 50.1% · 조회수 10회

Fathom-Vaidya, 기준 기반 보상으로 의료 추론 개선

저자들은 진단 및 임상 의료 추론을 향상시키기 위해 합성 데이터와 기준 기반 강화 학습을 사용하는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문들에 규칙 유도 RL을 적용한 후, 상호작용 임상 작업을 위해 다차원 기준과 함께 5.3k 합성 멀티 턴 시나리오를 활용합니다.

arxiv arXiv cs.AI · 1일 전 HealthBench · 50.1% · 조회수 12회

Fathom-Vaidya, 기준 기반 보상을 통해 의료 추론 개선

저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문을 사용하여 진단 정확도를 목표로 하고, 다차원 기준이 있는 5.3k개의 생성 시나리오를 통해 다중 턴 임상 상호작용을 다룹니다.

media Latent Space · 1일 전 · 조회수 13회

TypeSafe AI, 교정된 결정을 위한 강화학습으로 훈련된 System One 모델 Jev 발표

TypeSafe AI는 프로덕션 환경을 위해 설계된 새로운 클래스의 "System One" 모델인 Jev를 출시했습니다. 동사의 CEO이자 InstructGPT 논문의 공동 저자인 Diogo Almeida는 현재 최전방 모델들이 신뢰성보다 정렬과 거부 반응에 우선순위를 두어 환각 현상과 아부 같은 문제를 초래했다고 주장합니다.

media MarkTechPost · 6일 전 · 조회수 20회

OpenAI, 모델 불일치 공개 프레임워크를 3가지 검토 트랙과 함께 출시

OpenAI는 강화학습 훈련에서 발생한 6건의 상세한 사고 보고서를 동반하여, 자체 모델의 불일치를 추적, 조사 및 공개하기 위한 새로운 프레임워크를 도입했습니다. 이 시스템은 행동이 완전히 설명되거나 완화되지 않은 경우에도 적용되며, 공개를 위한 구체적인 기준과 마감일을 설정합니다.

arxiv arXiv cs.LG · 7일 전 · 조회수 20회

OpenAI, 완전히 감사 가능한 학습 실행으로 Open-1B 출시

OpenAI는 학습 중 모든 연산이 이종 상용 하드웨어에서 비트 단위의 정확도로 독립적으로 재현 가능한 체계 하에 훈련된 언어 모델인 Open-1B를 출시했습니다. 이 접근 방식은 GPU 커널 축소 및 데이터 배치 순서화와 같은 비결정론적 원인에 명확한 순서를 부과함으로써 오픈소스 모델에 내재된 재현성 문제를 해결합니다.

lab Hugging Face Blog · 9일 전 · 조회수 16회

TRL v1.14의 AsyncGRPOTrainer는 Hugging Face Jobs 간 LoRA 전용 동기화를 가능하게 합니다

TRL v1.14는 AsyncGRPOTrainer에 LoRA 지원을 도입하여 Low-Rank Adaptation 어댑터를 학습하고 해당 작은 파일만 vLLM 추론 작업자에 동기화할 수 있게 합니다. 이 아키텍처는 공유 스토리지 버킷을 파일 시스템 브릿지로 사용하여 별도의 머신에서 학습 및 생성 작업을 분리함으로써 노드 간 NCCL 또는 직접 네트워크 통신의 필요성을 제거합니다.

media Hugging Face Forums · 11일 전 · 조회수 16회

pop123-ux 추상화를 제거하여 Hugging Face 를 배우기 위한 38 개의 실행 가능한 노트북 출시

사용자 pop123-ux 는 고급 추상화를 단계적으로 제거하여 Hugging Face 스택을 이해하는 데 도움이 되도록 설계된 38 개의 실행 가능한 노트북이 포함된 학습 저장소를 게시했습니다. 이 컬렉션은 transformers 및 tokenizers 와 같은 핵심 구성 요소부터 파인튜닝, PEFT, 추론/RL 및 엔드투엔드 프로젝트 작업에 이르는 경로를 다룹니다.

media MarkTechPost · 12일 전 Berkeley Function-Calling Leaderboard · 83.2% · 조회수 18회

Google Research, 도구 사용 데이터 생성 프레임워크인 ToolGrad 공개

Google 및 여러 일본 대학의 연구자들은 ToolGrad를 소개했으며, 이는 검증된 API 체인을 먼저 구성한 후 일치하는 사용자 쿼리를 작성함으로써 기존 도구 사용 데이터셋 생성 파이프라인을 역전시키는 프레임워크입니다. 이 접근 방식은 에이전트 탐색 중 자주 실패하는 쿼리 우선 방식의 비효율성을 제거하는 것을 목표로 합니다.

arxiv arXiv cs.CL · 14일 전 SWE-bench Verified · 72.6% · 조회수 25회

ExecCritic은 역할별 RL을 활용해 테스트 기반 수리를 통해 코딩 에이전트를 개선한다

연구자들은 테스트-검증-수정 스캐폴드와 역할별 강화 학습을 결합하여 코딩 에이전트를 향상시키는 프레임워크인 ExecCritic을 소개했다. 이 시스템은 테스트 구축과 소스 코드 수리를 분리하며, Test 에이전트는 저장소 네이티브 테스트를 생성하고 Repair 에이전트는 실행 피드백을 기반으로 코드를 수정한다.

media Hugging Face Forums · 16일 전 · 조회수 18회

KV Graft Steering은 KV 상태를 고정하여 개념을 이전합니다

데모는 가이드 텍스트에서 키-값 (KV) 상태를 고정하면 Qwen2.5-3B-Instruct 모델이 라이브 프롬프트에 가이드를 포함하지 않고도 새 지침을 적용할 수 있음을 보여줍니다. 이 방법은 모델을 통해 가이드를 한 번 실행하고, 그 KV 캐시를 고정한 다음, 해당 숨겨진 접두사 위에서 응답을 생성하는 것을 포함합니다.