샤오미, MiMo-V2.6 Pro 및 Flash 모델 오픈소스화
샤오미는 대화형 3D 장면을 구축하고 시각적으로 테스트하기 위해 에이전트를 조정하도록 설계된 MiMo-V2.6 Pro 및 Flash 오모다모델 모델을 오픈소스화했습니다. 이 모델은 Blender 애셋을 생성하고, 카메라 피드에서 로봇 팔을 제어하며, 프론트엔드와 프레젠테이션을 제작하고, 비디오를 조립하고, 악보와 MIDI로 음악을 작곡할 수 있습니다.
샤오미는 대화형 3D 장면을 구축하고 시각적으로 테스트하기 위해 에이전트를 조정하도록 설계된 MiMo-V2.6 Pro 및 Flash 오모다모델 모델을 오픈소스화했습니다. 이 모델은 Blender 애셋을 생성하고, 카메라 피드에서 로봇 팔을 제어하며, 프론트엔드와 프레젠테이션을 제작하고, 비디오를 조립하고, 악보와 MIDI로 음악을 작곡할 수 있습니다.
AntLing은 두 개의 6B 파라미터 모델인 Ming-Image-0.1-Design과 Ming-Image-0.1-Design-Layer를 포함한 Ming-Image-0.1-Design 패밀리를 출시했습니다.
샤오미는 MiMo-V2.6 시리즈를 출시하며 MiMo-V2.6-Pro와 MiMo-V2.6-Flash를 포함한 네이티브 올모달 모델을 선보였습니다. 또한 회사는 동일한 품질에서 최대 20배 빠른 출력 속도를 제공하는 MiMo-V2.6-Pro-UltraSpeed도 출시했습니다.
AWS Strands Agents 팀은 Python과 TypeScript용 Apache 2.0 라이선스로 제공되는 범용 에이전트 하네스인 Strands Harness를 출시했습니다. 이 도구는 Claude Code나 Codex와 같은 환경에서 에이전트를 프로토타이핑하는 것과 커스텀 루프로 배포하는 것 사이의 격차를 해소하도록 설계되었습니다.
Microsoft Research는 두 개의 보완적 모델을 결합하여 고품질 합성 경로를 제안하는 새로운 역합성 예측 프레임워크인 RetroChimera를 출판하고 오픈소스로 공개했습니다. 이 시스템은 학습된 앙상블 전략을 사용하여 R-SMILES 2(Transformer 기반의 de-novo 모델)와 NeuralLoc(GNN 기반 모델)을 통합하고 예측을 순위 매깁니다.
알리바바의 Qwen 팀은 이전의 별도 체크포인트를 단일 7B 파라미터 디퓨전 트랜스포머로 통합한 텍스트-이미지 생성 및 이미지 편집용 통합 모델인 Qwen-Image-2.1을 출시했습니다.
tokenizers 라이브러리가 텍스트 인코딩 성능을 크게 개선하고 훈련 및 서빙 워크플로우의 병목 현상을 해결한 버전 1 출시 후보판을 출시했습니다. 이 업데이트는 v0.23과의 API 호환성을 유지하면서 열 가지 모델 계열 전반에 걸쳐 상당한 속도 향상을 제공합니다.
Multiverse는 대규모 언어 모델의 프루닝을 이징 글래스에 매핑된 제약 조건 이진 최적화 문제로 재정의하는 방법을 상세히 설명한 논문을 발표했습니다. 트랜스포머 블록을 손실 헤시안에서 유도된 쌍상호작용을 가진 스핀으로 취급함으로써, 이 접근법은 반복적인 벤치마킹 없이도 최적의 블록 제거 구성을 식별합니다.
저자는 오픈웨이트 모델의 현황에 대한 브리핑을 제시하며, 약 2025년 4월 이후 중국 AI 기업들이 이 분야에서 명확한 선두주자가 되었음을 지적합니다. 이러한 변화는 Hugging Face 다운로드 지표와 능력 벤치마크에서의 성과로 입증됩니다.
Qwen은 이미지 생성 및 편집 모두를 위해 설계된 통합 모델인 오픈 웨이트 Qwen-Image-2.1을 출시했습니다.
Stepfun은 현재 제품과 API를 통해 사용할 수 있는 Step 5 Preview 600B-A27B 모델을 출시했습니다. 이 모델의 오픈 웨이트 버전은 10월 15일에 출시됩니다.
stepfun-ai/Step-5-Preview-BF16 저장소가 Hugging Face에 게시되었습니다. 제출 제목은 해당 모델이 유망해 보인다고 나타냅니다.
Stepfun의 새로운 "Step 5" 모델의 미리보기가 온라인에 유출되었습니다.
알리바바는 암과 약 150개의 다른 의료 상태를 감지할 수 있는 오픈소스 의료 인공지능 모델을 출시했습니다.
inclusionAI는 Hugging Face에 Realtime-Venus 시스템을 출시했으며, 여기에는 두 가지 체크포인트인 Realtime-Venus-Omni와 Realtime-Venus-Audio가 포함되어 있습니다. Omni 체크포인트는 MiniCPM-o 4.5에서 파생된 9B 오디오-비주얼 상호작용 모델로, 지속적으로 관찰하고 듣다가 응답할 시점을 결정합니다.
칭화대 다이 지펑 교수가 설립한 스텔스 스타트업 Naive AI는 총 4억 달러의 3차 자금 조달 라운드를 완료하여 14억 달러 이상의 가치를 달성했습니다. 이 회사는 이번 달 중으로 오픈 가중치 릴리스로 첫 대규모 언어 모델인 Naive를 출시할 준비를 하고 있습니다.
Tencent은 Qwen3-VL 모델에서 파인튜닝된 페이지 이미지를 위한 엔드투엔드 문서 파서인 WeVisDoc을 출시했습니다. 이 시스템은 LaTeX 수식과 HTML 테이블을 포함한 구조화된 Markdown으로 페이지 이미지를 변환합니다.
Tencent은 페이지 이미지를 구조화된 Markdown(LaTeX 수식 및 HTML 테이블 포함)로 변환하는 엔드투엔드 문서 파서인 WeVisDoc-4B를 출시했습니다. Qwen3-VL-4B-Instruct에서 파인튜닝된 이 모델은 OmniDocBench v1.6에서 종합 점수 95.38을 달성했으며, 보고된 모든 네 가지 설정에서 비교된 파서 중 1위를 차지했습니다.
Together는 관리형 서비스를 활용하여 기업이 폐쇄형 AI 모델에서 오픈소스 모델(OSM)로 마이그레이션할 수 있는 프레임워크를 제공하며, 복잡성을 줄이고 채택을 가속화하는 것을 목표로 합니다. 이 과정에는 벤치마크를 통해 적합한 모델을 발견하고, 트래픽 리플레이를 통해 평가하며, 프롬프트나 가중치를 조정하고, 전환의 정당성을 위해 ROI를 계산하는 것이 포함됩니다.
모질라의 보고서에 따르면 중국의 오픈 가중치 AI 모델은 미국 프론티어 제품에 비해 개발 격차가 단 4개월로 좁혀졌습니다. 이러한 빠른 진전에도 불구하고 모델들은 일부 벤치마크 평가에서 여전히 뒤처지고 있습니다.