DeepSeek, 네이티브 멀티모달 지원을 갖춘 V4.1-Flash 모델 출시
DeepSeek는 새로운 아키텍처 패밀리의 가장 작은 구성원이며 네이티브 멀티모달 시각 이해 기능을 갖춘 DeepSeek-V4.1-Flash 모델을 공식적으로 출시했습니다. 이 새로운 아키텍처는 더 높은 능력 한계, 더 빠른 추론 속도, 더 높은 처리량 및 더 큰 모델에 대한 더 나은 확장 가능성을 제공하도록 설계되었습니다.
DeepSeek는 새로운 아키텍처 패밀리의 가장 작은 구성원이며 네이티브 멀티모달 시각 이해 기능을 갖춘 DeepSeek-V4.1-Flash 모델을 공식적으로 출시했습니다. 이 새로운 아키텍처는 더 높은 능력 한계, 더 빠른 추론 속도, 더 높은 처리량 및 더 큰 모델에 대한 더 나은 확장 가능성을 제공하도록 설계되었습니다.
마이크로소프트 리서치는 생물학의 다중 모달 세계 모델과 모델, 과학적 도구, 문헌, 연구자를 연결하는 상호작용형 하니스를 구축하기 위해 설계된 새로운 연구 노력인 Quine을 소개했습니다. 이 시스템은 과학자들이 습식 실험 환경에서 테스트할 제안을 생성하고, 그 결과를 통해 향후 질문을 정제할 수 있도록 함으로써 계산 모델링과 실제 실험 간의 격차를 해소하는 것을 목표로 합니다.
구글은 거의 실시간 비디오 생성과 음성을 결합하여 네이티브 라이브 대화 모델용 동적인 시각적 페르소나를 만들어내는 기능인 라이브 아바타가 탑재된 제미니 3.8 라이브를 출시했습니다.
알리바바의 Qwen 팀은 오디오-비디오 이해와 도구 사용을 위해 에이전트 기능을 중심으로 설계된 최초의 올모달 모델인 Qwen3.8-Omni-Flash를 출시했습니다. 이 모델은 텍스트, 이미지, 오디오, 비디오 입력을 받아 텍스트 출력을 반환하며, 1M 토큰 컨텍스트 윈도우와 네이티브 함수 호출 기능을 갖추고 있습니다.
v0.29.0rc2 릴리스에는 접두사 덮개 항목을 적절히 처리하기 위한 SHM 작업자 캐시의 버그 수정이 포함되어 있습니다.
llama.cpp 서버가 이제 /v1/embeddings 엔드포인트에 대한 유형별 콘텐츠(비전, 오디오, 비디오) 입력을 지원합니다. 이 업데이트는 OpenAI 스타일의 래핑된 콘텐츠 배열을 수락하여 텍스트와 image_url 부분을 함께 처리함으로써 멀티모달 임베딩 요청을 가능하게 합니다.
Hugging Face 포럼의 한 학부생은 슬라이드 컨텍스트가 있는 오디오 녹음 중 환각 문제를 해결하기 위해 VAPO 논문의 개념을 Qwen 2.5 Omni 3B 모델에 적용하는 것을 논의하고 있습니다.
Liquid AI는 자사의 LFM2.5-VL-3B 비전-언어 모델을 위한 실험적 추측적 디코딩 드래프트 모델인 LFM2.5-VL-3B-DSpark를 출시했습니다. 이 드래프터는 약 280M개의 파라미터를 추가하여 모델의 출력 분포를 변경하지 않고 토큰 생성을 가속화합니다.
Liquid AI는 LFM2.5-VL-3B 비전-언어 모델의 추론을 가속화하기 위해 설계된 추측적 디코딩용 드래프터인 LFM2.5-VL-DSpark 드래프트 모델을 출시했습니다. 이 드래프터는 대상 모델의 고정된 레이어에서 은닉 상태를 포착하여 후보 토큰을 생성하며, 모달리티 간 차원을 동일하게 유지하면서 280M 파라미터(8.9% 오버헤드)만 추가합니다.
Liquid AI는 시각-언어 모델 LFM2.5-VL-3B를 위한 실험용 DSpark 초안 모델을 출시하여 출력 품질을 변경하지 않고 에지 장치 및 GPU에서 더 빠른 디코딩을 가능하게 했습니다.
Apple은 압축된 텍스트 이미지를 더 효율적으로 처리하도록 설계된 90억 파라미터 Vision Language Model인 LensVLM-9B를 출시했습니다. 이 모델은 이러한 압축된 입력을 스캔하고 학습된 도구를 사용하여 관련 페이지만 선택적으로 비압축 형태로 확장합니다.
Alibaba Cloud는 이전 오미 모델에 비해 멀티모달 이해와 추론을 크게 향상시키는 실세계 생산성 작업을 위해 설계된 네이티브 멀티모달 에이전트 모델인 Qwen3.8-Omni-Flash를 소개했습니다.
알리바바 Qwen 팀은 실시간 화자를 들으며 화자가 말하는 동안 번역된 텍스트와 오디오를 반환하는 차세대 실시간 동시 통역 모델인 Qwen3.8-LiveTranslate를 출시했습니다. 이번 릴리스는 지연 시간을 줄이고 번역 품질을 향상시키기 위해 설계된 새로운 Interleave 아키텍처를 도입합니다.
inclusionAI는 Hugging Face에 Realtime-Venus 시스템을 출시했으며, 여기에는 두 가지 체크포인트인 Realtime-Venus-Omni와 Realtime-Venus-Audio가 포함되어 있습니다. Omni 체크포인트는 MiniCPM-o 4.5에서 파생된 9B 오디오-비주얼 상호작용 모델로, 지속적으로 관찰하고 듣다가 응답할 시점을 결정합니다.
DeepSeek는 에이전트 워크로드에서 긴 컨텍스트 계산과 큰 KV 캐시의 높은 비용을 해결하도록 설계된 멀티모달 Mixture-of-Experts 모델인 DeepSeek-V4.1-Flash를 출시했습니다.
Tencent은 Qwen3-VL 모델에서 파인튜닝된 페이지 이미지를 위한 엔드투엔드 문서 파서인 WeVisDoc을 출시했습니다. 이 시스템은 LaTeX 수식과 HTML 테이블을 포함한 구조화된 Markdown으로 페이지 이미지를 변환합니다.
Tencent은 페이지 이미지를 구조화된 Markdown(LaTeX 수식 및 HTML 테이블 포함)로 변환하는 엔드투엔드 문서 파서인 WeVisDoc-4B를 출시했습니다. Qwen3-VL-4B-Instruct에서 파인튜닝된 이 모델은 OmniDocBench v1.6에서 종합 점수 95.38을 달성했으며, 보고된 모든 네 가지 설정에서 비교된 파서 중 1위를 차지했습니다.
Intern Large Models가 Hugging Face에서 사용할 수 있는 Intern-S2-397B 모델을 출시했습니다. 이번 출시에는 모델 실행을 위한 vLLM의 Day-0 지원이 포함되어 있습니다.
InternLM은 과학적 지능과 장기 에이전트를 위해 설계된 3970억 파라미터 규모의 멀티모달 파운데이션 모델인 Intern-S2-397B를 선보였습니다. 이 모델은 사전 훈련, 강화학습 작업 커버리지, 상호작용 에이전트 환경 전반에 걸쳐 확장되어 일반 추론 및 에이전트 능력을 향상시킵니다.
IBM와 NASA는 미국 및 일본 미션으로부터 수십 년간의 다중 모드 달 데이터를 단일 표현으로 통합하는 AI 시스템인 NASA-IBM Lunar Foundation Model을 오픈소스로 공개했습니다. IBM의 TerraMind 아키텍처를 기반으로 구축된 이 모델은 복잡한 조명과 데이터 해상도와 같은 과제를 해결하기 위해 다양한 스케일과 시야각에서의 관측을 통합합니다.