ByteDance의 Seed 팀은 오디오, 비디오, 텍스트를 단일 통합 아키텍처에 융합하는 네이티브 오디오-비주얼 풀듀플렉스 대규모 언어 모델인 SeedRealtime를 출시했습니다. ASR, VLM, TTS 모듈의 전통적인 캐스케이디드 스택과 달리 SeedRealtime는 지속적인 멀티모달 스트림을 통한 실시간 상호작용을 위해 지각, 이해, 의사결정, 표현을 병렬로 실행합니다.
- 해당 모델은 외부 음성 활동 감지기를 내부 턴 테이킹 메커니즘으로 대체했습니다.
- 멀티모달 간 아이덴티티 바인딩, 보유된 명령에 따른 능동적 발화, 시각적 상태 기반 교정을 보여줍니다.
- 인간 평가 보고서에 따르면 캐스케이디드 스택과 비교하여 패싱 문제가 절반으로 줄어든 것으로 나타났습니다.
- SeedRealtime는 현재 ByteDance의 Doubao 앱 내에서 운영 중이지만 기술 보고서, 오픈 가중치 또는 공개 API 엔드포인트는 없습니다.
이번 출시는 실시간 음성+카메라 제품에 대한 검증된 참조 아키텍처 역할을 하며, 즉각적인 서드파티 통합 옵션이 부재함에도 불구하고 올모디 상호작용에 대한 새로운 벤치마크를 확립합니다.