연구소 · Alibaba (Qwen)
media MarkTechPost · 12일 전 · 조회수 35회

알리바바 Qwen이 에이전트형 올모달 모델인 Qwen3.8-Omni-Flash를 1M 컨텍스트로 출시

알리바바의 Qwen 팀은 오디오-비디오 이해와 도구 사용을 위해 에이전트 기능을 중심으로 설계된 최초의 올모달 모델인 Qwen3.8-Omni-Flash를 출시했습니다. 이 모델은 텍스트, 이미지, 오디오, 비디오 입력을 받아 텍스트 출력을 반환하며, 1M 토큰 컨텍스트 윈도우와 네이티브 함수 호출 기능을 갖추고 있습니다.

media MarkTechPost · 2일 전 · 조회수 4회

알리바바 Qwen이 전이중 음성 모델인 Qwen-Audio-3.1-Realtime를 출시

알리바바의 Qwen 팀은 새로운 Qwen-Audio-3.1-Realtime-plus를 포함한 5개 모델로 구성된 오디오 스택인 Qwen-Audio-3.1을 출시했으며, 이는 추론과 도구 사용이 가능한 음성 에이전트를 위해 설계된 전이중 음성 모델입니다. 이번 출시에서는 ASR 서비스에 최대 95%의 가격 인하도 도입되었습니다.

arxiv arXiv cs.AI · 2일 전 · 조회수 1회

RareDx는 그래프 기반 정책 최적화를 통해 희귀 질환 진단을 개선한다

저자들은 희귀 질환 진단의 장타원 추론 문제를 해결하기 위해 통제된 증거 활용과 지식 그래프 기반 정책 최적화를 결합한 시스템인 RareDx를 소개합니다. 학습 파이프라인은 Top-10 사후 훈련과 RareDx-KGPO를 결합하며, 이는 예측을 표준 질환 그래프로 투영하고 선별된 등급 관련성, 온톨로지 근접성, 생물의학적 유사성 및 표현형 일관성을 통합합니다.

arxiv arXiv cs.CL · 2일 전 · 조회수 1회

Rep2Act가 새로운 VAD-R 벤치마크에서 기권 능력을 향상시키기 위해 VLM 표현을 정렬

연구자들은 Visual Answerability Diagnosis with Rationales(VAD-R)이라는 새로운 벤치마크를 소개했으며, 이는 단서 없이 답할 수 없는 질문에 대해 기권하는 능력과 관련된 시각-언어 모델의 성능을 평가하기 위해 설계되었습니다. 연구 결과, 은닉 상태가 답변 가능성을 구분할 수는 있지만 현재 모델들은 이를 명시적인 결정으로 전환하지 못하는 것으로 드러났습니다.

arxiv arXiv cs.CL · 7일 전 · 조회수 8회

VHD-Play는 해결된 메커니즘에서 에이전트형 RL 환경을 생성합니다

VHD-Play는 수학적 모델을 샘플링하고 해결한 후 의사결정 과정을 상태 유지 도구로 렌더링하여 다양한 에이전트형 강화학습 환경을 생성하는 파이프라인입니다. 이 접근 방식은 실행 가능한 동역학과 궤적 평가 기준이 해결된 모델에서 직접 상속되도록 하여 기존 생성 파이프라인에서 흔히 발생하는 정렬 문제를 해결합니다.

arxiv arXiv cs.CL · 7일 전 SWE-Lancer · 51.47% · 조회수 10회

SkillGym이 LLM에 인간 기술을 내재화하여 현실 문제 해결을 가능하게 함

연구진은 SkillGym을 소개합니다. 이는 인간이 작성한 에이전트 기술을 대형 언어 모델 에이전트를 위한 실행 가능하고 검증 가능한 학습 환경으로 변환하는 프레임워크입니다. 이 시스템은 기술-작업 파이프라인을 활용하여 구체적인 작업을 인스턴스화하고 코드 기반 체크기로 결과를 검증합니다.

arxiv arXiv cs.AI · 8일 전 · 조회수 17회

VideoX-Qwen이 지시 기반 비디오 편집을 위한 데이터 중심 프레임워크 소개

연구원들은 확장 가능한 데이터 구축과 모델 학습을 결합하여 범용 지시 기반 비디오 편집을 발전시키는 통합 프레임워크인 VideoX-Qwen을 제시했습니다. 이 시스템은 방향성 편집 레코드를 생성하기 위해 특수화된 모델을 조직하는 생산 파이프라인을 활용하며, 추가, 제거, 교체 및 속성 작업에 걸쳐 120만 개 이상의 고품질 샘플을 생성합니다.

media MarkTechPost · 11일 전 · 조회수 28회

알리바바 Qwen 팀이 Interleave 아키텍처를 갖춘 Qwen3.8-LiveTranslate 출시

알리바바 Qwen 팀은 실시간 화자를 들으며 화자가 말하는 동안 번역된 텍스트와 오디오를 반환하는 차세대 실시간 동시 통역 모델인 Qwen3.8-LiveTranslate를 출시했습니다. 이번 릴리스는 지연 시간을 줄이고 번역 품질을 향상시키기 위해 설계된 새로운 Interleave 아키텍처를 도입합니다.

lab Hugging Face Blog · 17일 전 · 조회수 19회

TRL v1.14의 AsyncGRPOTrainer는 Hugging Face Jobs 간 LoRA 전용 동기화를 가능하게 합니다

TRL v1.14는 AsyncGRPOTrainer에 LoRA 지원을 도입하여 Low-Rank Adaptation 어댑터를 학습하고 해당 작은 파일만 vLLM 추론 작업자에 동기화할 수 있게 합니다. 이 아키텍처는 공유 스토리지 버킷을 파일 시스템 브릿지로 사용하여 별도의 머신에서 학습 및 생성 작업을 분리함으로써 노드 간 NCCL 또는 직접 네트워크 통신의 필요성을 제거합니다.

media Hugging Face Forums · 17일 전 · 조회수 29회

고립 테스트는 통과하지만 문맥적 복사에 실패하는 'FragileTokens'를 식별한 연구

연구는 "FragileTokens"를 특성화했는데, 이는 개방형 가중치 언어 모델의 어휘 항목으로, 고립되었을 때는 성공적으로 복사되지만 주변 텍스트에 삽입되면 오류를 보입니다. 이 연구는 표준 고립 테스트가 문자 그대로의 정체성 보존을 보장하지 않는다고 강조합니다. 시퀀스 내에서 토큰이 삭제, 대체 또는 잘릴 수 있기 때문입니다.

arxiv arXiv cs.AI · 22일 전 SWE-bench Verified · 72.6% · 조회수 31회

ExecCritic은 역할별 RL을 활용하여 테스트 기반 수리를 통해 코딩 에이전트를 개선합니다

ExecCritic은 코딩 에이전트의 잘못된 자신감을 방지하기 위해 테스트 구성과 소스 코드 수리를 분리하는 프레임워크를 도입합니다. 이 시스템은 Qwen-3.5-35B-A3B로 구동되는 Test 에이전트와 Repair 에이전트를 사용하며, 두 에이전트는 각각 강화 학습을 통해 훈련됩니다.

arxiv arXiv cs.CL · 22일 전 SWE-bench Verified · 72.6% · 조회수 32회

ExecCritic은 역할별 RL을 활용해 테스트 기반 수리를 통해 코딩 에이전트를 개선한다

연구자들은 테스트-검증-수정 스캐폴드와 역할별 강화 학습을 결합하여 코딩 에이전트를 향상시키는 프레임워크인 ExecCritic을 소개했다. 이 시스템은 테스트 구축과 소스 코드 수리를 분리하며, Test 에이전트는 저장소 네이티브 테스트를 생성하고 Repair 에이전트는 실행 피드백을 기반으로 코드를 수정한다.