Video generation
arxiv arXiv cs.AI · 5시간 전 · 조회수 10회

VideoX-Qwen이 지시 기반 비디오 편집을 위한 데이터 중심 프레임워크 소개

연구원들은 확장 가능한 데이터 구축과 모델 학습을 결합하여 범용 지시 기반 비디오 편집을 발전시키는 통합 프레임워크인 VideoX-Qwen을 제시했습니다. 이 시스템은 방향성 편집 레코드를 생성하기 위해 특수화된 모델을 조직하는 생산 파이프라인을 활용하며, 추가, 제거, 교체 및 속성 작업에 걸쳐 120만 개 이상의 고품질 샘플을 생성합니다.

lab NVIDIA Research · 8일 전 · 조회수 15회

FastGen-PDD, 빠른 비디오 및 이미지 생성을 위한 병렬 디코딩 지식 증류 도입

연구자들은 확산 모델과 흐름 매칭 모델의 추론 속도를 가속화하기 위한 단순화된 궤적 기반 방법인 병렬 디코딩 지식 증류(PDD)를 소개합니다. 현재 접근 방식이 최적화가 어려운 변분 점수 지식 증류와 적대적 손실에 의존하는 것과 달리, PDD는 단일 네트워크 평가당 여러 디노이징 단계를 예측합니다.

media Hugging Face Forums · 10일 전 · 조회수 20회

NanoAvatar, Qualcomm QNN을 통해 Android에서 로컬 대화 아바타 가능하게 함

NanoAvatar는 클라우드 GPU 없이도 오래된 Android 폰에서 생생한 대화 아바타를 로컬로 실행하는 오픈소스 프로젝트입니다. 이번 릴리스에는 공개 코드, 모델 가중치, 그리고 사용자의 자신의 음성으로 오프라인 사용을 위해 모델과 아바타를 번들한 Android APK가 포함되어 있습니다.