Qwen, NVIDIA, Mistral, Black Forest Labs가 새로운 모델 출시; 라우팅과 안전성 주목
2026년 8월 3-4일자 AI 뉴스 요약에서는 Alibaba Qwen, NVIDIA, Mistral AI, Black Forest Labs의 주요 모델 출시와 에이전트 라우팅, 인프라, 사이버 보안 분야의 동향을 다룹니다.
2026년 8월 3-4일자 AI 뉴스 요약에서는 Alibaba Qwen, NVIDIA, Mistral AI, Black Forest Labs의 주요 모델 출시와 에이전트 라우팅, 인프라, 사이버 보안 분야의 동향을 다룹니다.
MiniMax는 텍스트, 이미지, 비디오, 오디오를 단일 컨텍스트에 통합하여 최대 15초 길이의 2K 비디오 클립과 네이티브 스테레오 사운드를 생성할 수 있는 범용 멀티모달 생성 모델인 MiniMax H3를 출시했습니다. 이전의 특정 작업에 전용 전문가 모델을 의존하던 스택과 달리, H3는 사용자가 자연어 프롬프트를 통해 참조 및 편집 관계를 표현할 수 있게 합니다.
xAI는 텍스트, 이미지, 음성 참조를 지원하도록 Imagine Video 1.5 모델을 업데이트하여 사용자가 최대 1080p 해상도의 동영상을 생성할 수 있게 되었습니다. 이 업데이트는 장면 간 얼굴과 음성을 고정하여 캐릭터의 일관성을 유지할 수 있도록 하며, 각 생성당 최대 7개의 참조를 지원합니다.
MiniMax는 텍스트, 이미지, 비디오 및 오디오에 걸쳐 통합된 컨텍스트를 이해하는 범용 멀티모달 생성 모델인 MiniMax H3를 출시했습니다. 이 모델은 최대 15초 길이의 2K 해상도 네이티브 스테레오 사운드 비디오를 생성합니다.
NVIDIA는 Cosmos-H-Surgical-Simulator의 기능을 인과적 학생 모델로 압축한 외과 로봇용 실시간 액션 조건부 생성 시뮬레이터인 Cosmos-H-Dreams를 출시했습니다. NVIDIA의 FlashDreams 가속 스트리밍 추론 라이브러리를 통해 제공되는 이 시스템은 폐쇄 루프 내에서 사람이나 학습된 정책이 상호작용할 수 있는 제어를 가능하게 합니다.
Black Forest Labs는 단일 아키텍처 내에서 이미지, 비디오, 오디오에서 학습하는 멀티모달 파운데이션 모델인 FLUX 3를 출시했습니다. 이는 하나의 가중치 세트에서 비디오, 오디오 및 액션 예측을 제공하는 최초의 FLUX 모델입니다.
Black Forest Labs는 네이티브 오디오 비디오 생성 기능을 갖춘 멀티모달 플로우 모델 패밀리인 FLUX 3을 출시했습니다. 이번 릴리스에는 비디오 액션 로봇 애플리케이션용으로 설계된 변형인 FLUX-mimic도 포함되어 있습니다.
NVIDIA와 Hugging Face는 NVIDIA NeMo Automodel을 🤗 Diffusers 라이브러리와 통합하여 오픈 소스 디퓨전 모델에 대한 프로덕션 수준의 분산 학습을 제공합니다. 이 협력을 통해 사용자는 체크포인트 변환이나 모델 코드 수정 없이 Hugging Face Hub에서 Diffusers 형식의 모델을 파인튜닝할 수 있습니다.
구글이 Google Vids에 두 가지 새로운 업데이트를 출시했습니다. 텍스트 기반 비디오 생성 및 편집을 위한 Gemini Omni 통합과 사용자가 개인 디지털 아바타를 생성할 수 있는 기능이 그것입니다. 이 도구들은 자연어 프롬프트와 이미지 참조로부터 클립을 생성하고, 실제 녹화 없이 비디오에 출연할 수 있도록 함으로써 비디오 제작을 간소화하는 것을 목표로 합니다.
모델 제공자로서 Kimi K3를 사용하여 생성된 viral video가 공유되었으며, 이는 창의적 작업에서의 능력을 보여줍니다. 크리에이터는 GLM 5.2를 사용한 이전 예시와 비교하여 출력 품질이 현저히 더 나아졌다고 언급했습니다.
연구자들은 안무를 연속 신호가 아닌 원자적 움직임의 시퀀스로 모델링하는 음악 구동 댄스 생성을 위한 구조 인식 프레임워크를 제시했다.
방대한 양의 영상 프레임을 지각하고 추론하며 행동할 수 있는 비디오 분석 AI 에이전트는 기존 워크플로우와 통합되어야 유용합니다. 이러한 워크플로우에는 콘텐츠 관리 시스템, 메시징 플랫폼, 데이터베이스, 티켓 대기열 및 에스컬레이션 경로가 포함됩니다.
연구자들은 Text2Sign을 제시했는데, 이는 짧은 수화 클립을 단일 NVIDIA L4 GPU에서 생성하도록 설계된 텍스트 조건부 디퓨전 모델로, 비디오 디퓨전 모델의 학습 및 평가와 관련된 높은 비용을 해결한다. 이 시스템은 고정된 비전-언어 텍스트 인코더, 3D 인코더-디코더, 그리고 분할된 시공간 어텐션을 결합하여 연산 요구사항을 줄이면서 운동 일관성을 유지한다.
광범위한 공간에서 비디오 분석 애플리케이션을 구축하는 개발자는 카메라 뷰 간에 이동하는 동일한 개체를 추적해야 합니다. 단일 카메라 2D 추적은 신뢰할 수 있는 깊이 정보를 결여하고 있으며, 일반적으로 개체가 프레임 밖으로 나가면 추적을 잃어 창고 안전, 소매 분석, 스마트 빌딩 모니터링 등의 애플리케이션을 제한합니다.
연구자들은 다중 볼 하드 스피어 동역학 시뮬레이션 중 인과 사슬이 길어짐에 따라 성능이 저하되는 비디오 확산 모델의 "직렬성 간극"을 식별했습니다. 통제 실험 결과, 이 저하는 비디오 길이보다는 의존적 사건 구조로 인해 발생하며 상호작용이 없는 단일 볼 제어에서는 사라지는 것으로 나타났습니다.
NVIDIA는 자율 코딩 AI 에이전트를 사용하여 Cosmos 3 비전 추론 모델을 사후 학습하면 최소한의 수동 노력으로 정확도를 90% 이상으로 높일 수 있음을 입증했습니다.
연구자들은 음악과 동기화된 장시간 고화질 댄스 영상을 생성하는 계층적 프레임워크인 Wan-Dancer를 소개했습니다. 이 시스템은 생성을 전역 키프레임 계획과 지역 시간적 정제로 분리하여 확산 모델의 일반적인 20초 제한을 극복합니다.
개발자 MorphLand는 인게임 NPC로 작동하기 위해 로컬 대규모 언어 모델을 통합한 무료 Steam 타이틀 "Simulation Simulator"를 출시했습니다. 이 게임은 플레이어가 AI 동반자에게 현실이 시뮬레이션임을 설득하려는 자유형 대화 경험입니다.