Video generation
media MarkTechPost · 8일 전 · 조회수 15회

MiniMax가 네이티브 스테레오 오디오로 2K 클립을 생성하는 올모달 비디오 모델 MiniMax H3 출시

MiniMax는 텍스트, 이미지, 비디오, 오디오를 단일 컨텍스트에 통합하여 최대 15초 길이의 2K 비디오 클립과 네이티브 스테레오 사운드를 생성할 수 있는 범용 멀티모달 생성 모델인 MiniMax H3를 출시했습니다. 이전의 특정 작업에 전용 전문가 모델을 의존하던 스택과 달리, H3는 사용자가 자연어 프롬프트를 통해 참조 및 편집 관계를 표현할 수 있게 합니다.

lab Hugging Face Blog · 13일 전 · 조회수 19회

NVIDIA, 외과 로봇용 실시간 생성 시뮬레이터 Cosmos-H-Dreams 출시

NVIDIA는 Cosmos-H-Surgical-Simulator의 기능을 인과적 학생 모델로 압축한 외과 로봇용 실시간 액션 조건부 생성 시뮬레이터인 Cosmos-H-Dreams를 출시했습니다. NVIDIA의 FlashDreams 가속 스트리밍 추론 라이브러리를 통해 제공되는 이 시스템은 폐쇄 루프 내에서 사람이나 학습된 정책이 상호작용할 수 있는 제어를 가능하게 합니다.

lab Hugging Face Blog · 23일 전 · 조회수 5회

NVIDIA NeMo Automodel은 Hugging Face Diffusers와 함께 분산 디퓨전 모델 파인튜닝을 가능하게 합니다

NVIDIA와 Hugging Face는 NVIDIA NeMo Automodel을 🤗 Diffusers 라이브러리와 통합하여 오픈 소스 디퓨전 모델에 대한 프로덕션 수준의 분산 학습을 제공합니다. 이 협력을 통해 사용자는 체크포인트 변환이나 모델 코드 수정 없이 Hugging Face Hub에서 Diffusers 형식의 모델을 파인튜닝할 수 있습니다.

lab Google — The Keyword (AI) · 23일 전 · 조회수 6회

구글, Google Vids에 Gemini Omni와 개인 아바타 추가

구글이 Google Vids에 두 가지 새로운 업데이트를 출시했습니다. 텍스트 기반 비디오 생성 및 편집을 위한 Gemini Omni 통합과 사용자가 개인 디지털 아바타를 생성할 수 있는 기능이 그것입니다. 이 도구들은 자연어 프롬프트와 이미지 참조로부터 클립을 생성하고, 실제 녹화 없이 비디오에 출연할 수 있도록 함으로써 비디오 제작을 간소화하는 것을 목표로 합니다.

arxiv arXiv cs.CL · 24일 전

Text2Sign: 텍스트-수화 영상 생성을 위한 단일 GPU 디퓨전 베이스라인

연구자들은 Text2Sign을 제시했는데, 이는 짧은 수화 클립을 단일 NVIDIA L4 GPU에서 생성하도록 설계된 텍스트 조건부 디퓨전 모델로, 비디오 디퓨전 모델의 학습 및 평가와 관련된 높은 비용을 해결한다. 이 시스템은 고정된 비전-언어 텍스트 인코더, 3D 인코더-디코더, 그리고 분할된 시공간 어텐션을 결합하여 연산 요구사항을 줄이면서 운동 일관성을 유지한다.

lab NVIDIA Technical Blog · 24일 전

NVIDIA DeepStream 9.1, 다중 카메라 3D 추적 지원

광범위한 공간에서 비디오 분석 애플리케이션을 구축하는 개발자는 카메라 뷰 간에 이동하는 동일한 개체를 추적해야 합니다. 단일 카메라 2D 추적은 신뢰할 수 있는 깊이 정보를 결여하고 있으며, 일반적으로 개체가 프레임 밖으로 나가면 추적을 잃어 창고 안전, 소매 분석, 스마트 빌딩 모니터링 등의 애플리케이션을 제한합니다.