주제 · Video generation
lab NVIDIA Research · 16일 전 · 조회수 20회

FastGen-PDD, 빠른 비디오 및 이미지 생성을 위한 병렬 디코딩 지식 증류 도입

연구자들은 확산 모델과 흐름 매칭 모델의 추론 속도를 가속화하기 위한 단순화된 궤적 기반 방법인 병렬 디코딩 지식 증류(PDD)를 소개합니다. 현재 접근 방식이 최적화가 어려운 변분 점수 지식 증류와 적대적 손실에 의존하는 것과 달리, PDD는 단일 네트워크 평가당 여러 디노이징 단계를 예측합니다.

media MarkTechPost · 7시간 전

NVIDIA 연구진, Cosmos 3 비디오 모델의 물리 추론 개선을 위해 Physis-Lang 공개

NVIDIA, MIT, 옥스퍼드 대학교 연구진은 captions에 자기 진화적 물리 언어를 통합하여 비디오 월드 모델을 강화하는 프레임워크인 Physis-Lang을 소개했습니다. 이 접근 방식은 물리 언어를 생성된 비디오의 물리 오류를 수정하기 위해 데이터 선별, 모델 학습 및 추론에 사용되는 최적화 가능한 표현으로 간주합니다.

media MarkTechPost · 3일 전 · 조회수 11회

Google Research, 일관된 수 분 길이의 비디오 생성을 위한 4개 에이전트 프레임워크 소개

Google Research는 다중 샷 파이프라인에서 흔히 발생하는 아이덴티티 드리프트와 연쇄 오류를 해결하여 일관되고 수 분 길이의 비디오를 생성하도록 설계된 네 개의 에이전트 프레임워크로 구성된 AI 비디오 공동 디렉터를 소개했습니다. 이 시스템은 Gemini와 Veo 위에 모델 비종속성 오케스트레이션 레이어로 작동하며, 출력에는 SynthID 워터마킹을 활용합니다.

media Latent Space · 6일 전 · 조회수 11회

Runway, 실시간 상호작용형 세계 생성을 위한 WorldPrompt 출시

Runway는 오토레그ressive 확산 모델을 사용하여 고품질 비디오 및 오디오 생성을 실시간 상호작용 시뮬레이션으로 전환하는 연구용 미리보기인 GWM Worlds 2를 출시했습니다. 이번 릴리스에는 환경의 측면을 고정하고 시간 표시 이벤트(timestamped events)를 생성하여 생성된 세계와 동작을 지정할 수 있는 새로운 입력 형식인 WorldPrompt가 포함되어 있습니다.

arxiv arXiv cs.AI · 8일 전 · 조회수 17회

VideoX-Qwen이 지시 기반 비디오 편집을 위한 데이터 중심 프레임워크 소개

연구원들은 확장 가능한 데이터 구축과 모델 학습을 결합하여 범용 지시 기반 비디오 편집을 발전시키는 통합 프레임워크인 VideoX-Qwen을 제시했습니다. 이 시스템은 방향성 편집 레코드를 생성하기 위해 특수화된 모델을 조직하는 생산 파이프라인을 활용하며, 추가, 제거, 교체 및 속성 작업에 걸쳐 120만 개 이상의 고품질 샘플을 생성합니다.

media Hugging Face Forums · 17일 전 · 조회수 26회

NanoAvatar, Qualcomm QNN을 통해 Android에서 로컬 대화 아바타 가능하게 함

NanoAvatar는 클라우드 GPU 없이도 오래된 Android 폰에서 생생한 대화 아바타를 로컬로 실행하는 오픈소스 프로젝트입니다. 이번 릴리스에는 공개 코드, 모델 가중치, 그리고 사용자의 자신의 음성으로 오프라인 사용을 위해 모델과 아바타를 번들한 Android APK가 포함되어 있습니다.