연구소 · ByteDance
media MarkTechPost · 5일 전 · 조회수 3회

ByteDance Seed, 네이티브 오디오-비주얼 풀듀플렉스 LLM인 SeedRealtime 출시

ByteDance의 Seed 팀은 오디오, 비디오, 텍스트를 단일 통합 아키텍처에 융합하는 네이티브 오디오-비주얼 풀듀플렉스 대규모 언어 모델인 SeedRealtime를 출시했습니다. ASR, VLM, TTS 모듈의 전통적인 캐스케이디드 스택과 달리 SeedRealtime는 지속적인 멀티모달 스트림을 통한 실시간 상호작용을 위해 지각, 이해, 의사결정, 표현을 병렬로 실행합니다.

media r/LocalLLaMA · 5일 전 · 조회수 9회

MiniMax, 네이티브 스테레오 오디오를 갖춘 오픈 웨이트 H3 비디오 생성 모델 출시

MiniMax는 Hugging Face에 오픈 웨이트 H3 오미모달 비디오 생성 모델을 출시했으며, 단일 포워드 패스에서 비디오를 구동할 수 있는 네이티브 스테레오 오디오를 특징으로 합니다. 이 모델은 5~15초 길이의 클립에 대해 2K 해상도와 24fps를 지원하며, 생성당 최대 9장의 참조 이미지, 3개의 비디오, 3개의 오디오 클립을 허용합니다.