Multimodal
media MarkTechPost · 3일 전 · 조회수 18회

알리바바 Qwen 팀이 Interleave 아키텍처를 갖춘 Qwen3.8-LiveTranslate 출시

알리바바 Qwen 팀은 실시간 화자를 들으며 화자가 말하는 동안 번역된 텍스트와 오디오를 반환하는 차세대 실시간 동시 통역 모델인 Qwen3.8-LiveTranslate를 출시했습니다. 이번 릴리스는 지연 시간을 줄이고 번역 품질을 향상시키기 위해 설계된 새로운 Interleave 아키텍처를 도입합니다.

media r/LocalLLaMA · 5일 전 · 조회수 36회

inclusionAI가 9B 오디오-비주얼 상호작용 모델인 Realtime-Venus를 출시

inclusionAI는 Hugging Face에 Realtime-Venus 시스템을 출시했으며, 여기에는 두 가지 체크포인트인 Realtime-Venus-Omni와 Realtime-Venus-Audio가 포함되어 있습니다. Omni 체크포인트는 MiniCPM-o 4.5에서 파생된 9B 오디오-비주얼 상호작용 모델로, 지속적으로 관찰하고 듣다가 응답할 시점을 결정합니다.

media MarkTechPost · 5일 전 · 조회수 24회

알리바바 Qwen이 에이전트형 올모달 모델인 Qwen3.8-Omni-Flash를 1M 컨텍스트로 출시

알리바바의 Qwen 팀은 오디오-비디오 이해와 도구 사용을 위해 에이전트 기능을 중심으로 설계된 최초의 올모달 모델인 Qwen3.8-Omni-Flash를 출시했습니다. 이 모델은 텍스트, 이미지, 오디오, 비디오 입력을 받아 텍스트 출력을 반환하며, 1M 토큰 컨텍스트 윈도우와 네이티브 함수 호출 기능을 갖추고 있습니다.

lab Tencent Hunyuan (HF) · 6일 전 · 조회수 64회

Tencent, 엔드투엔드 문서 파서 WeVisDoc-4B 출시

Tencent은 페이지 이미지를 구조화된 Markdown(LaTeX 수식 및 HTML 테이블 포함)로 변환하는 엔드투엔드 문서 파서인 WeVisDoc-4B를 출시했습니다. Qwen3-VL-4B-Instruct에서 파인튜닝된 이 모델은 OmniDocBench v1.6에서 종합 점수 95.38을 달성했으며, 보고된 모든 네 가지 설정에서 비교된 파서 중 1위를 차지했습니다.

lab IBM Research (Granite) · 13일 전 · 조회수 24회

IBM와 NASA가 NASA-IBM Lunar Foundation Model을 오픈소스화

IBM와 NASA는 미국 및 일본 미션으로부터 수십 년간의 다중 모드 달 데이터를 단일 표현으로 통합하는 AI 시스템인 NASA-IBM Lunar Foundation Model을 오픈소스로 공개했습니다. IBM의 TerraMind 아키텍처를 기반으로 구축된 이 모델은 복잡한 조명과 데이터 해상도와 같은 과제를 해결하기 위해 다양한 스케일과 시야각에서의 관측을 통합합니다.

lab DeepSeek API Docs · 13일 전 Codeforces (Elo) · 3471.0Elo · 조회수 51회

DeepSeek, 네이티브 멀티모달 지원을 갖춘 V4.1-Flash 모델 출시

DeepSeek는 새로운 아키텍처 패밀리의 가장 작은 구성원이며 네이티브 멀티모달 시각 이해 기능을 갖춘 DeepSeek-V4.1-Flash 모델을 공식적으로 출시했습니다. 이 새로운 아키텍처는 더 높은 능력 한계, 더 빠른 추론 속도, 더 높은 처리량 및 더 큰 모델에 대한 더 나은 확장 가능성을 제공하도록 설계되었습니다.

media MarkTechPost · 18일 전 · 조회수 33회

구글, 제미니 플래시 모델에 에이전틱 비디오 이해 기능 출시

구글은 제미니 플래시 모델 전반에 에이전틱 비디오 이해 기능을 출시했으며, 이는 이전의 정적 처리 방식을 대체하여 필요할 때 비디오 타임라인을 탐색하는 시스템으로 전환되었습니다. 이 변경으로 모델은 고정된 초당 1프레임의 방식으로 전체 타임라인을 일괄 입력하는 대신, 무엇을 볼지, 어떤 프레임 레이트로 볼지, 그리고 어떤 모달리티를 통해 접근할지를 결정할 수 있게 되었습니다.

arxiv arXiv cs.CL · 19일 전 · 조회수 36회

VisCAD가 다중 모달 산업용 CAD 지능을 갖춘 파운데이션 모델 스위트 출시

연구진은 VisCAD를 발표했으며, 이는 현실적인 산업 제품 설계를 위해 광범위한 일반화와 강력한 능력을 제공하도록 설계된 파운데이션 모델 스위트입니다. 이 스위트는 렌더링과 텍스트와 같은 다양한 입력으로부터 부품 수준 생성, 그리고 상호 작용하는 부품을 포함하는 어셈블리 수준 생성의 과제를 해결합니다.

lab Hugging Face Blog · 20일 전 · 조회수 34회

NeoMME가 밀집 및 후기 상호작용 검색을 위한 효율적인 다중모달 인코더 출시

연구자들은 텍스트와 원시 이미지 패치를 단일 양방향 Transformer로 처리하는 260M 및 800M 다국어 다중모달 인코더 계열인 NeoMME를 소개합니다. 생성형 시각 언어 모델과 달리 NeoMME는 별도의 사전 학습된 비전 타워나 인과적 디코더에 의존하지 않으며, 마스킹 이산 확산 목적 함수로 전체 모델을 처음부터 훈련합니다.