xAI, Imagine Video 1.5에 이미지 및 음성 참조 추가
xAI는 텍스트, 이미지, 음성 참조를 지원하도록 Imagine Video 1.5 모델을 업데이트하여 사용자가 최대 1080p 해상도의 동영상을 생성할 수 있게 되었습니다. 이 업데이트는 장면 간 얼굴과 음성을 고정하여 캐릭터의 일관성을 유지할 수 있도록 하며, 각 생성당 최대 7개의 참조를 지원합니다.
xAI는 텍스트, 이미지, 음성 참조를 지원하도록 Imagine Video 1.5 모델을 업데이트하여 사용자가 최대 1080p 해상도의 동영상을 생성할 수 있게 되었습니다. 이 업데이트는 장면 간 얼굴과 음성을 고정하여 캐릭터의 일관성을 유지할 수 있도록 하며, 각 생성당 최대 7개의 참조를 지원합니다.
구글이 Google Vids에 두 가지 새로운 업데이트를 출시했습니다. 텍스트 기반 비디오 생성 및 편집을 위한 Gemini Omni 통합과 사용자가 개인 디지털 아바타를 생성할 수 있는 기능이 그것입니다. 이 도구들은 자연어 프롬프트와 이미지 참조로부터 클립을 생성하고, 실제 녹화 없이 비디오에 출연할 수 있도록 함으로써 비디오 제작을 간소화하는 것을 목표로 합니다.
연구원들은 작업을 시간 조건부 잠재 도메인 번역으로 재구성하여 장시간 비디오 리라이트의 시간적 불연속성을 해결합니다. 이 프레임워크는 경계를 통해 대상 도메인 잠재 변수를 전파하여 청크 간 연속성을 강제하고, 마스크된 대상 도메인 자기 조건화를 사용하여 이 동작을 학습 가능하게 만듭니다.
LTX는 NVIDIA RTX GPU와 DGX Spark 하드웨어에서 로컬 추론에 최적화된 비디오 생성, 실시간 애플리케이션 및 물리 AI용 오픈 가중치 월드 모델인 LTX-2.5를 출시했습니다. 이번 출시는 VRAM 요구 사항을 줄이고 세대별 요금을 제거함으로써 클라우드 인프라에서 로컬 데스크톱으로 비디오 제작을 전환하는 것을 목표로 합니다.
MiniMax는 텍스트, 이미지, 비디오 및 오디오를 처리할 수 있는 오픈 가중치 멀티모달 비디오 생성 모델인 MiniMax H3를 출시했습니다. 이 모델은 오디오를 사후 처리 단계로 추가하는 대신 시각적 요소와 동기화된 스테레오 오디오(대화, 효과음, 환경음 및 음악 포함)를 함께 생성합니다.
MiniMax는 Hugging Face에 오픈 웨이트 H3 오미모달 비디오 생성 모델을 출시했으며, 단일 포워드 패스에서 비디오를 구동할 수 있는 네이티브 스테레오 오디오를 특징으로 합니다. 이 모델은 5~15초 길이의 클립에 대해 2K 해상도와 24fps를 지원하며, 생성당 최대 9장의 참조 이미지, 3개의 비디오, 3개의 오디오 클립을 허용합니다.
2026년 8월 3-4일자 AI 뉴스 요약에서는 Alibaba Qwen, NVIDIA, Mistral AI, Black Forest Labs의 주요 모델 출시와 에이전트 라우팅, 인프라, 사이버 보안 분야의 동향을 다룹니다.
MiniMax는 텍스트, 이미지, 비디오, 오디오를 단일 컨텍스트에 통합하여 최대 15초 길이의 2K 비디오 클립과 네이티브 스테레오 사운드를 생성할 수 있는 범용 멀티모달 생성 모델인 MiniMax H3를 출시했습니다. 이전의 특정 작업에 전용 전문가 모델을 의존하던 스택과 달리, H3는 사용자가 자연어 프롬프트를 통해 참조 및 편집 관계를 표현할 수 있게 합니다.
MiniMax는 텍스트, 이미지, 비디오 및 오디오에 걸쳐 통합된 컨텍스트를 이해하는 범용 멀티모달 생성 모델인 MiniMax H3를 출시했습니다. 이 모델은 최대 15초 길이의 2K 해상도 네이티브 스테레오 사운드 비디오를 생성합니다.
NVIDIA는 Cosmos-H-Surgical-Simulator의 기능을 인과적 학생 모델로 압축한 외과 로봇용 실시간 액션 조건부 생성 시뮬레이터인 Cosmos-H-Dreams를 출시했습니다. NVIDIA의 FlashDreams 가속 스트리밍 추론 라이브러리를 통해 제공되는 이 시스템은 폐쇄 루프 내에서 사람이나 학습된 정책이 상호작용할 수 있는 제어를 가능하게 합니다.
Black Forest Labs는 단일 아키텍처 내에서 이미지, 비디오, 오디오에서 학습하는 멀티모달 파운데이션 모델인 FLUX 3를 출시했습니다. 이는 하나의 가중치 세트에서 비디오, 오디오 및 액션 예측을 제공하는 최초의 FLUX 모델입니다.
Black Forest Labs는 네이티브 오디오 비디오 생성 기능을 갖춘 멀티모달 플로우 모델 패밀리인 FLUX 3을 출시했습니다. 이번 릴리스에는 비디오 액션 로봇 애플리케이션용으로 설계된 변형인 FLUX-mimic도 포함되어 있습니다.
NVIDIA와 Hugging Face는 NVIDIA NeMo Automodel을 🤗 Diffusers 라이브러리와 통합하여 오픈 소스 디퓨전 모델에 대한 프로덕션 수준의 분산 학습을 제공합니다. 이 협력을 통해 사용자는 체크포인트 변환이나 모델 코드 수정 없이 Hugging Face Hub에서 Diffusers 형식의 모델을 파인튜닝할 수 있습니다.
모델 제공자로서 Kimi K3를 사용하여 생성된 viral video가 공유되었으며, 이는 창의적 작업에서의 능력을 보여줍니다. 크리에이터는 GLM 5.2를 사용한 이전 예시와 비교하여 출력 품질이 현저히 더 나아졌다고 언급했습니다.
방대한 양의 영상 프레임을 지각하고 추론하며 행동할 수 있는 비디오 분석 AI 에이전트는 기존 워크플로우와 통합되어야 유용합니다. 이러한 워크플로우에는 콘텐츠 관리 시스템, 메시징 플랫폼, 데이터베이스, 티켓 대기열 및 에스컬레이션 경로가 포함됩니다.