Google DeepMind, Gboard 및 Live Transcribe용 SL2T 수화-텍스트 모델 출시
Google DeepMind와 Android는 수화 AI를 소비자 제품에 최초로 도입하는 대규모 다국어 수화-텍스트(SL2T) 번역 모델인 SL2T를 선보였습니다. 이 기술은 Pixel 11의 Gboard 및 Live Transcribe에서 수화-텍스트 음성 입력을 지원하며, 미국 수화(ASL)에서 영어로의 번역으로 시작됩니다.
Google DeepMind와 Android는 수화 AI를 소비자 제품에 최초로 도입하는 대규모 다국어 수화-텍스트(SL2T) 번역 모델인 SL2T를 선보였습니다. 이 기술은 Pixel 11의 Gboard 및 Live Transcribe에서 수화-텍스트 음성 입력을 지원하며, 미국 수화(ASL)에서 영어로의 번역으로 시작됩니다.
구글 리서치와 구글 딥마인드는 의료 AI 연구 시스템인 AMIE를 발전시켜 최초의 연구에서 실시간 임상 비디오 상담 기능을 시연했습니다. Gemini와 Project Astra를 기반으로 멀티 에이전트 아키텍처를 사용하여 구축된 이 시스템은 시각적 및 청각적 단서를 해석하고 가상 신체 검사를 안내하며 실시간으로 진단적 추론을 수행합니다.
마이크로소프트 리서치는 연결성, 포위, 순서, 분리 및 매듭에 대한 위상적 직관을 다중 모달 대규모 언어 모델이 갖추고 있는지 평가하기 위해 설계된 새로운 벤치마크인 MindTopo를 선보였습니다.
마이크로소프트 리서치는 생성적 보고서 작성과 보정된 진단 예측을 결합하여 현재 방사선학 비전-라이트 모델의 격차를 해결하도록 설계된 연구 모델인 CARE-X를 선보였습니다. 이 시스템은 임상적 정확성에 대한 보상을 위해 강화 학습(DAPO)을 사용하며, 정밀한 계산이 필요한 상태에 대한 성능 평가를 위해 Qwen3-VL-4B-Instruct 모델을 결정론적 측정 도구와 페어링합니다.
연구자들은 GenRecal을 제시했습니다. 이는 대규모 비전-언어 모델(VLM)에서 더 작고 효율적인 대응 모델로 지식을 전달하는 범용 증류 프레임워크입니다. 이 방법은 서로 다른 모델 유형 간에 특징 표현을 정렬하고 적응시키기 위한 Re-calibrator를 사용하여 이종 VLM 아키텍처의 과제를 해결합니다.
연구자들은 시각적 증거를 활용하는 컴팩트한 비전-라ngu아지 모델의 능력을 향상시키는 새로운 생각-답변 증류 프레임워크를 제안했습니다. 이는 중요한 추론 접두사를 마스킹하여 달성됩니다. 이 접근 방식은 긴 생각-답변 추적에서 일반적으로 발생하는 "시각적 망각" 문제를 해결합니다. 학생들은 확장된 추론 동안 시각적 단서에 대한 집중력을 잃습니다.
NVIDIA 연구진은 다중 모달 대규모 언어 모델(MLLMs)의 공간 지능을 해체하기 위해 설계된 진단 프레임워크인 Spatial-IQ를 출시했습니다. 모델을 블랙 박스로 취급하는 기존 벤치마크와 달리, 이 접근 방식은 쌓여 있는 3D 구조에서의 객체 카운팅을 인간 발달 단계와 일치하는 아홉 가지 지각 및 인지 하위 작업으로 분해합니다.
연구자들은 경쟁 슈팅 게임 Delta Force의 게임플레이 비디오를 분석하여 제스처와 이동 패턴과 같은emergent한 비언어적 의사소통을 추출하고 이해합니다. 이 작업은 주로 MOBA 게임이나 다른 슈터 게임에서의 언어적 협조에 초점을 맞춘 기존 연구의 gap을 해결합니다.
갤럭시 언팩드 2026에서 구글은 새로운 삼성 갤럭시 Z Fold8 Ultra, Fold8, Flip8를 위한 세 가지 업데이트를 발표했으며, 이는 제미나이 인텔리전스의 보급에 중점을 둡니다. 회사는 작업 자동화 기능을 40개 이상의 인기 앱으로 확장하고, 제미나이 노트북 앱을 이 기기에 직접 도입합니다.
Meta는 Hugging Face Hub에서 오픈 소스로 제공되는 밀집형 30B 파라미터 멀티모달 모델인 Muse Glimmer를 출시했습니다. 아키텍처는 28B 텍스트 디코더와 비전 작업을 위한 2B ViT 스타일 Perception Encoder로 구성됩니다.
Shieldstral은 콘텐츠 검수를 정책 적응형 질문 답변 작업으로 구성하는 3B 오픈 가중치 다중 모달 안전 분류기로, 재학습 없이 추론 시 일반 언어 정책을 받아들일 수 있습니다. 이는 텍스트와 이미지 안전 평가를 통합하고 다양한 벤치마크에서 교정된 안전 점수를 제공하며 단일 16GB NVIDIA GPU에서 효율적으로 실행됩니다.
7월 19일, 알리바바의 Qwen 팀은 2.4조 개의 파라미터를 가진 새로운 플래그십 다중 모달 모델인 Qwen3.8-Max-Preview를 미리 선보였습니다. 이 발표는 상하이에서 열린 월드 AI 컨퍼런스 동안 이루어졌으며, Moonshot AI가 Kimi K3 모델을 출시한 지 이틀 만에 발표되었습니다.
저자들은 다중 모달 과학적 이해, 추론, 생성 및 장기 작업을 지원하도록 설계된 일련의 과학적 에이전트 파운데이션 모델인 Intern-S2-Preview를 제시합니다. 학습 파이프라인은 렌더링된 과학 문서, 교차된 이미지-텍스트 데이터 및 다양한 과학 코퍼스에 대한 과학적 다중 모달 사전 훈련을 시작으로 합니다.
dots-studio는 자신의 dots3 계열의 첫 번째 오픈 가중치 모델을 dots3-note preview라는 이름으로 출시했습니다. 이 Mixture-of-Experts 모델은 총 280B 파라미터를 가지고 있으며 16B가 활성화되고 최대 512K 토큰의 컨텍스트를 지원합니다.
Liquid AI는 효율적인 온디바이스 배포를 위해 설계된 3.1B 파라미터의 비전-언어 모델인 LFM2.5-VL-3B를 출시했습니다. 이 모델은 모바일, 웹, 데스크톱 환경에서 디지털 화면을 읽고, 객체를 좌표에 매핑하며, 문서를 구문 분석하고, 텍스트 또는 이미지 입력으로부터 도구 호출을 실행합니다.
연구자들은 SCOUT를 제안했는데, 이는 구조화된 사고사슬과 다목적 프로세스 보상 강화학습을 결합하여 비전-언어 모델의 공간 추론을 향상시키는 프레임워크입니다. 이 접근법은 기존 RL 방법의 신용 할당 문제를 해결하고 포괄적인 3D 이해를 위해 깊이 지각을 통합합니다.
Liquid AI는 엣지 디바이스에서 향상되고 빠른 성능을 제공하도록 설계된 30억 파라미터의 비전-라이트 모델인 LFM2.5-VL-3B를 출시했습니다. 이 모델은 SigLIP2 400M NaFlex 비전 인코더와 이전 텍스트 전용 버전의 백본을 결합했으며, 이전 출시 대비 4배 더 많은 비전 데이터를 포함해 약 34조 개의 토큰으로 학습되었습니다.
LFM2.5-VL-3B는 실시간 및 온디바이스 애플리케이션을 위한 낮은 지연 시간을 유지하면서 더 큰 모델들과 경쟁력 있는 성능을 제공하는 새로운 비전-라틴어 모델입니다. 이 모델은 이전 LFM2-VL-3B 릴리스를 기반으로 화면 이해, 그라운딩, 함수 호출, 다중 이미지 입력 기능에서 상당한 개선을 이루었습니다.
연구자들은 저지연 대화를 실시간 오디오비주얼 지각과 통합하는 Gemini 기반 멀티 에이전트 시스템인 AMIE (Video)를 사용하여 실시간 임상 비디오 상담을 위한 최초의 전문가 수준 AI 시스템을 시연했습니다. 30명의 일차 진료 의사 및 100개의 시나리오가 포함된 무작위 구조화 임상 시험 연구에서 임상 평가자들은 병력 청취, 진단, 관리 및 신체 관찰에서 시스템을 의사들과 동등하거나 더 우수하다고 평가했습니다.
연구자들은 저지연 대화를 실시간 오디오비주얼 지각과 통합하는 Gemini 기반 다중 에이전트 시스템인 AMIE (Video)를 사용하여 실시간 임상 비디오 상담을 위한 최초의 전문가 수준 AI 시스템을 시연했습니다.