VideoX-Qwen이 지시 기반 비디오 편집을 위한 데이터 중심 프레임워크 소개
연구원들은 확장 가능한 데이터 구축과 모델 학습을 결합하여 범용 지시 기반 비디오 편집을 발전시키는 통합 프레임워크인 VideoX-Qwen을 제시했습니다. 이 시스템은 방향성 편집 레코드를 생성하기 위해 특수화된 모델을 조직하는 생산 파이프라인을 활용하며, 추가, 제거, 교체 및 속성 작업에 걸쳐 120만 개 이상의 고품질 샘플을 생성합니다.
연구원들은 확장 가능한 데이터 구축과 모델 학습을 결합하여 범용 지시 기반 비디오 편집을 발전시키는 통합 프레임워크인 VideoX-Qwen을 제시했습니다. 이 시스템은 방향성 편집 레코드를 생성하기 위해 특수화된 모델을 조직하는 생산 파이프라인을 활용하며, 추가, 제거, 교체 및 속성 작업에 걸쳐 120만 개 이상의 고품질 샘플을 생성합니다.
Higgsfield AI는 내부 개발 워크플로우를 가속화하고 비디오 광고 제작 플랫폼을 강화하기 위해 OpenAI의 GPT-6 Astra 모델을 통합했습니다. 회사는 이 모델이 한 명의 엔지니어가 단 하루 만에 새로운 탐색 기능을 제공할 수 있게 한다고 보고합니다.
연구자들은 확산 모델과 흐름 매칭 모델의 추론 속도를 가속화하기 위한 단순화된 궤적 기반 방법인 병렬 디코딩 지식 증류(PDD)를 소개합니다. 현재 접근 방식이 최적화가 어려운 변분 점수 지식 증류와 적대적 손실에 의존하는 것과 달리, PDD는 단일 네트워크 평가당 여러 디노이징 단계를 예측합니다.
NanoAvatar는 클라우드 GPU 없이도 오래된 Android 폰에서 생생한 대화 아바타를 로컬로 실행하는 오픈소스 프로젝트입니다. 이번 릴리스에는 공개 코드, 모델 가중치, 그리고 사용자의 자신의 음성으로 오프라인 사용을 위해 모델과 아바타를 번들한 Android APK가 포함되어 있습니다.
Vidu S2에는 실시간 대화형 디지털 캐릭터 모델인 Vidu S2-Avatar와 실시간 비디오 편집 모델인 Vidu S2-Editing이 포함됩니다. 이 시스템은 두 구성 요소 모두에 대한 실시간 공간 비디오 생성의 실현 가능성도 탐구합니다.
한 사용자가 새로 출시된 DeepSeek V4.1 Flash 모델을 사용하여 생성한 동영상을 게시하여 모션 비디오 합성에서의 능력을 벤치마킹했습니다.
한 사용자가 Seedance 및 기타 모델에 대한 접근을 제공하는 AIide API 플랫폼을 활용하여 AI 생성 비디오를 만들기 위해 Seedance 2.5를 실험하고 있습니다.
사용자는 다양한 의상, 구도 및 시각적 스타일로 단일 캐릭터가 등장하는 짧은 패션 및 편집 시퀀스를 사용하여 Seedance 2.5 비디오 생성 모델을 테스트했습니다.
2026년 9월 초, 엔비디아는 허깅페이스를 129억 3천만 달러에 인수한다고 확인했으며, 오픈에이아이는 GPT-6 Astra를 출시하고 마이크로소프트는 MAI-Transcribe-2 음성 인식 모델을 출시했습니다.
한 사용자가 시퀀스 전반에 걸쳐 시각적 일관성을 유지하는 능력을 평가하기 위해 짧은 패션 및 편집 스타일 비디오 컨셉을 사용하여 Seedance 2.5 모델을 테스트했습니다.
구글은 단순 생성에서 지시 가능한 편집으로 초점을 전환하는 네이티브 멀티모달 비디오 생성 모델의 프로덕션 업데이트인 제미니 오미 1.1 플래시를 출시했습니다.
Google은 Gemini API를 통해 장면 확장, 첫 번째 및 마지막 프레임 보간, 4K 업스케일링 및 더 빠른 비디오 반복을 위한 새로운 제어를 갖춘 Gemini Omni 1.1 Flash를 출시했습니다.
Seedance 2 AI 비디오 생성 모델에 대한 평가는 이전 버전과 비교하여 시네마틱 요소에 대한 이해도가 향상되었음을 강조합니다. 테스트는 모델이 시각적 연속성과 조명을 잘 처리하지만 복잡한 객체 일관성과 프롬프트 과부하에는 여전히 어려움을 겪고 있음을 보여줍니다.
오픈AI 수석 과학자 야쿱 파초키는 미출시된 아스트라 모델이 2026년 9월까지 "자동화된 AI 연구 인턴"이 되기를 목표로 한다고 밝혔으며, CEO 샘 알트만은 회사가 2026년 12월 내에 내부적으로 AGI 달성을 선언할 것으로 추정한다고 말했다.
구글은 Gemini API를 통해 Google AI Studio에서 전문적인 사용을 위해 모델이 프로덕션 준비가 되도록 설계된 새로운 창의적 컨트롤과 생성형 비디오 기능 세트를 선보이는 Gemini Omni 1.1 Flash를 소개했습니다.