주제 · Video generation
lab Google — The Keyword (AI) · 29일 전 · 조회수 7회

구글, Google Vids에 Gemini Omni와 개인 아바타 추가

구글이 Google Vids에 두 가지 새로운 업데이트를 출시했습니다. 텍스트 기반 비디오 생성 및 편집을 위한 Gemini Omni 통합과 사용자가 개인 디지털 아바타를 생성할 수 있는 기능이 그것입니다. 이 도구들은 자연어 프롬프트와 이미지 참조로부터 클립을 생성하고, 실제 녹화 없이 비디오에 출연할 수 있도록 함으로써 비디오 제작을 간소화하는 것을 목표로 합니다.

lab NVIDIA Research · 7시간 전 · 조회수 3회

HorizonRelight는 일관된 장시간 비디오 리라이트를 위해 마스크된 자기 조건화를 사용합니다

연구원들은 작업을 시간 조건부 잠재 도메인 번역으로 재구성하여 장시간 비디오 리라이트의 시간적 불연속성을 해결합니다. 이 프레임워크는 경계를 통해 대상 도메인 잠재 변수를 전파하여 청크 간 연속성을 강제하고, 마스크된 대상 도메인 자기 조건화를 사용하여 이 동작을 학습 가능하게 만듭니다.

media MarkTechPost · 3일 전 · 조회수 7회

LTX가 로컬 비디오 생성을 위한 오픈 가중치 월드 모델 LTX-2.5를 출시

LTX는 NVIDIA RTX GPU와 DGX Spark 하드웨어에서 로컬 추론에 최적화된 비디오 생성, 실시간 애플리케이션 및 물리 AI용 오픈 가중치 월드 모델인 LTX-2.5를 출시했습니다. 이번 출시는 VRAM 요구 사항을 줄이고 세대별 요금을 제거함으로써 클라우드 인프라에서 로컬 데스크톱으로 비디오 제작을 전환하는 것을 목표로 합니다.

media r/LocalLLaMA · 5일 전 · 조회수 11회

MiniMax, 동기화된 오디오를 갖춘 오픈 가중치 H3 비디오 모델 출시

MiniMax는 텍스트, 이미지, 비디오 및 오디오를 처리할 수 있는 오픈 가중치 멀티모달 비디오 생성 모델인 MiniMax H3를 출시했습니다. 이 모델은 오디오를 사후 처리 단계로 추가하는 대신 시각적 요소와 동기화된 스테레오 오디오(대화, 효과음, 환경음 및 음악 포함)를 함께 생성합니다.

media r/LocalLLaMA · 5일 전 · 조회수 9회

MiniMax, 네이티브 스테레오 오디오를 갖춘 오픈 웨이트 H3 비디오 생성 모델 출시

MiniMax는 Hugging Face에 오픈 웨이트 H3 오미모달 비디오 생성 모델을 출시했으며, 단일 포워드 패스에서 비디오를 구동할 수 있는 네이티브 스테레오 오디오를 특징으로 합니다. 이 모델은 5~15초 길이의 클립에 대해 2K 해상도와 24fps를 지원하며, 생성당 최대 9장의 참조 이미지, 3개의 비디오, 3개의 오디오 클립을 허용합니다.

media MarkTechPost · 14일 전 · 조회수 17회

MiniMax가 네이티브 스테레오 오디오로 2K 클립을 생성하는 올모달 비디오 모델 MiniMax H3 출시

MiniMax는 텍스트, 이미지, 비디오, 오디오를 단일 컨텍스트에 통합하여 최대 15초 길이의 2K 비디오 클립과 네이티브 스테레오 사운드를 생성할 수 있는 범용 멀티모달 생성 모델인 MiniMax H3를 출시했습니다. 이전의 특정 작업에 전용 전문가 모델을 의존하던 스택과 달리, H3는 사용자가 자연어 프롬프트를 통해 참조 및 편집 관계를 표현할 수 있게 합니다.

lab Hugging Face Blog · 19일 전 · 조회수 23회

NVIDIA, 외과 로봇용 실시간 생성 시뮬레이터 Cosmos-H-Dreams 출시

NVIDIA는 Cosmos-H-Surgical-Simulator의 기능을 인과적 학생 모델로 압축한 외과 로봇용 실시간 액션 조건부 생성 시뮬레이터인 Cosmos-H-Dreams를 출시했습니다. NVIDIA의 FlashDreams 가속 스트리밍 추론 라이브러리를 통해 제공되는 이 시스템은 폐쇄 루프 내에서 사람이나 학습된 정책이 상호작용할 수 있는 제어를 가능하게 합니다.

lab Hugging Face Blog · 28일 전 · 조회수 5회

NVIDIA NeMo Automodel은 Hugging Face Diffusers와 함께 분산 디퓨전 모델 파인튜닝을 가능하게 합니다

NVIDIA와 Hugging Face는 NVIDIA NeMo Automodel을 🤗 Diffusers 라이브러리와 통합하여 오픈 소스 디퓨전 모델에 대한 프로덕션 수준의 분산 학습을 제공합니다. 이 협력을 통해 사용자는 체크포인트 변환이나 모델 코드 수정 없이 Hugging Face Hub에서 Diffusers 형식의 모델을 파인튜닝할 수 있습니다.

lab NVIDIA Technical Blog · 29일 전 · 조회수 1회

NVIDIA, 엔터프라이즈 워크플로우에 컨텍스트 인식 비디오 AI 에이전트 통합 논의

방대한 양의 영상 프레임을 지각하고 추론하며 행동할 수 있는 비디오 분석 AI 에이전트는 기존 워크플로우와 통합되어야 유용합니다. 이러한 워크플로우에는 콘텐츠 관리 시스템, 메시징 플랫폼, 데이터베이스, 티켓 대기열 및 에스컬레이션 경로가 포함됩니다.