Qwen, 100만 토큰 컨텍스트를 갖춘 네이티브 멀티모달 에이전트 모델 Qwen3.8-Omni-Flash 출시
Alibaba Cloud는 이전 오미 모델에 비해 멀티모달 이해와 추론을 크게 향상시키는 실세계 생산성 작업을 위해 설계된 네이티브 멀티모달 에이전트 모델인 Qwen3.8-Omni-Flash를 소개했습니다.
Alibaba Cloud는 이전 오미 모델에 비해 멀티모달 이해와 추론을 크게 향상시키는 실세계 생산성 작업을 위해 설계된 네이티브 멀티모달 에이전트 모델인 Qwen3.8-Omni-Flash를 소개했습니다.
알리바바 Qwen 팀은 실시간 화자를 들으며 화자가 말하는 동안 번역된 텍스트와 오디오를 반환하는 차세대 실시간 동시 통역 모델인 Qwen3.8-LiveTranslate를 출시했습니다. 이번 릴리스는 지연 시간을 줄이고 번역 품질을 향상시키기 위해 설계된 새로운 Interleave 아키텍처를 도입합니다.
inclusionAI는 Hugging Face에 Realtime-Venus 시스템을 출시했으며, 여기에는 두 가지 체크포인트인 Realtime-Venus-Omni와 Realtime-Venus-Audio가 포함되어 있습니다. Omni 체크포인트는 MiniCPM-o 4.5에서 파생된 9B 오디오-비주얼 상호작용 모델로, 지속적으로 관찰하고 듣다가 응답할 시점을 결정합니다.
알리바바의 Qwen 팀은 오디오-비디오 이해와 도구 사용을 위해 에이전트 기능을 중심으로 설계된 최초의 올모달 모델인 Qwen3.8-Omni-Flash를 출시했습니다. 이 모델은 텍스트, 이미지, 오디오, 비디오 입력을 받아 텍스트 출력을 반환하며, 1M 토큰 컨텍스트 윈도우와 네이티브 함수 호출 기능을 갖추고 있습니다.
DeepSeek는 에이전트 워크로드에서 긴 컨텍스트 계산과 큰 KV 캐시의 높은 비용을 해결하도록 설계된 멀티모달 Mixture-of-Experts 모델인 DeepSeek-V4.1-Flash를 출시했습니다.
Tencent은 Qwen3-VL 모델에서 파인튜닝된 페이지 이미지를 위한 엔드투엔드 문서 파서인 WeVisDoc을 출시했습니다. 이 시스템은 LaTeX 수식과 HTML 테이블을 포함한 구조화된 Markdown으로 페이지 이미지를 변환합니다.
Tencent은 페이지 이미지를 구조화된 Markdown(LaTeX 수식 및 HTML 테이블 포함)로 변환하는 엔드투엔드 문서 파서인 WeVisDoc-4B를 출시했습니다. Qwen3-VL-4B-Instruct에서 파인튜닝된 이 모델은 OmniDocBench v1.6에서 종합 점수 95.38을 달성했으며, 보고된 모든 네 가지 설정에서 비교된 파서 중 1위를 차지했습니다.
Intern Large Models가 Hugging Face에서 사용할 수 있는 Intern-S2-397B 모델을 출시했습니다. 이번 출시에는 모델 실행을 위한 vLLM의 Day-0 지원이 포함되어 있습니다.
InternLM은 과학적 지능과 장기 에이전트를 위해 설계된 3970억 파라미터 규모의 멀티모달 파운데이션 모델인 Intern-S2-397B를 선보였습니다. 이 모델은 사전 훈련, 강화학습 작업 커버리지, 상호작용 에이전트 환경 전반에 걸쳐 확장되어 일반 추론 및 에이전트 능력을 향상시킵니다.
IBM와 NASA는 미국 및 일본 미션으로부터 수십 년간의 다중 모드 달 데이터를 단일 표현으로 통합하는 AI 시스템인 NASA-IBM Lunar Foundation Model을 오픈소스로 공개했습니다. IBM의 TerraMind 아키텍처를 기반으로 구축된 이 모델은 복잡한 조명과 데이터 해상도와 같은 과제를 해결하기 위해 다양한 스케일과 시야각에서의 관측을 통합합니다.
DeepSeek이 새로운 모델 DeepSeek V4-1 Flash을 출시했습니다. 이는 5520억 파라미터의 백본을 갖춘 멀티모달 Mixture-of-Experts (MoE) 모델입니다.
DeepSeek는 새로운 아키텍처 패밀리의 가장 작은 구성원이며 네이티브 멀티모달 시각 이해 기능을 갖춘 DeepSeek-V4.1-Flash 모델을 공식적으로 출시했습니다. 이 새로운 아키텍처는 더 높은 능력 한계, 더 빠른 추론 속도, 더 높은 처리량 및 더 큰 모델에 대한 더 나은 확장 가능성을 제공하도록 설계되었습니다.
inclusionAI는 네이티브 이미지 및 비디오 이해 기능을 통해 전작의 언어 및 추론 능력을 확장한 오픈소스 Ling-3.0-flash-VL 모델을 출시했습니다.
DeepSeek는 이제 API를 통해 사용할 수 있는 DeepSeek V4.1 Flash 모델의 중간 버전의 내부 베타 테스트를 시작했습니다.
구글은 제미니 플래시 모델 전반에 에이전틱 비디오 이해 기능을 출시했으며, 이는 이전의 정적 처리 방식을 대체하여 필요할 때 비디오 타임라인을 탐색하는 시스템으로 전환되었습니다. 이 변경으로 모델은 고정된 초당 1프레임의 방식으로 전체 타임라인을 일괄 입력하는 대신, 무엇을 볼지, 어떤 프레임 레이트로 볼지, 그리고 어떤 모달리티를 통해 접근할지를 결정할 수 있게 되었습니다.
llama.cpp 버전 0.4.0은 Qwen3.8-Flash-Next 및 NVIDIA Nemotron-3-Puzzle-75B-A9B 모델에 대한 초기 아키텍처 지원을 도입하고, 기반 ggml 라이브러리를 버전 0.23.0으로 업그레이드했습니다.
Ling-3.0-flash-VL은 시각적 이해와 시각적 에이전트 기능을 도입한 Ling-3.0-flash 아키텍처를 기반으로 한 새로운 모델입니다.
연구진은 VisCAD를 발표했으며, 이는 현실적인 산업 제품 설계를 위해 광범위한 일반화와 강력한 능력을 제공하도록 설계된 파운데이션 모델 스위트입니다. 이 스위트는 렌더링과 텍스트와 같은 다양한 입력으로부터 부품 수준 생성, 그리고 상호 작용하는 부품을 포함하는 어셈블리 수준 생성의 과제를 해결합니다.
연구자들은 텍스트와 원시 이미지 패치를 단일 양방향 Transformer로 처리하는 260M 및 800M 다국어 다중모달 인코더 계열인 NeoMME를 소개합니다. 생성형 시각 언어 모델과 달리 NeoMME는 별도의 사전 학습된 비전 타워나 인과적 디코더에 의존하지 않으며, 마스킹 이산 확산 목적 함수로 전체 모델을 처음부터 훈련합니다.
v0.29.0rc2 릴리스에는 접두사 덮개 항목을 적절히 처리하기 위한 SHM 작업자 캐시의 버그 수정이 포함되어 있습니다.