알리바바, 아스라 컨퍼런스에서 Qwen 4 발표
알리바바는 아스라 컨퍼런스 동안 Qwen 4의 출시를 공식적으로 발표했습니다.
알리바바는 아스라 컨퍼런스 동안 Qwen 4의 출시를 공식적으로 발표했습니다.
알리바바의 Qwen 팀은 오디오-비디오 이해와 도구 사용을 위해 에이전트 기능을 중심으로 설계된 최초의 올모달 모델인 Qwen3.8-Omni-Flash를 출시했습니다. 이 모델은 텍스트, 이미지, 오디오, 비디오 입력을 받아 텍스트 출력을 반환하며, 1M 토큰 컨텍스트 윈도우와 네이티브 함수 호출 기능을 갖추고 있습니다.
알리바바의 Qwen 팀은 새로운 Qwen-Audio-3.1-Realtime-plus를 포함한 5개 모델로 구성된 오디오 스택인 Qwen-Audio-3.1을 출시했으며, 이는 추론과 도구 사용이 가능한 음성 에이전트를 위해 설계된 전이중 음성 모델입니다. 이번 출시에서는 ASR 서비스에 최대 95%의 가격 인하도 도입되었습니다.
ISTA 심층 알고리즘 및 시스템 연구소는 희소 혼합 전문가 모델인 Qwen3.8-Flash-Next의 양자화된 GGUF 버전을 출시했으며, 동시에 전문가 절반을 제거한 실험적 기능 타겟팅 빌드도 함께 공개했습니다.
저자들은 희귀 질환 진단의 장타원 추론 문제를 해결하기 위해 통제된 증거 활용과 지식 그래프 기반 정책 최적화를 결합한 시스템인 RareDx를 소개합니다. 학습 파이프라인은 Top-10 사후 훈련과 RareDx-KGPO를 결합하며, 이는 예측을 표준 질환 그래프로 투영하고 선별된 등급 관련성, 온톨로지 근접성, 생물의학적 유사성 및 표현형 일관성을 통합합니다.
연구자들은 Visual Answerability Diagnosis with Rationales(VAD-R)이라는 새로운 벤치마크를 소개했으며, 이는 단서 없이 답할 수 없는 질문에 대해 기권하는 능력과 관련된 시각-언어 모델의 성능을 평가하기 위해 설계되었습니다. 연구 결과, 은닉 상태가 답변 가능성을 구분할 수는 있지만 현재 모델들은 이를 명시적인 결정으로 전환하지 못하는 것으로 드러났습니다.
VHD-Play는 수학적 모델을 샘플링하고 해결한 후 의사결정 과정을 상태 유지 도구로 렌더링하여 다양한 에이전트형 강화학습 환경을 생성하는 파이프라인입니다. 이 접근 방식은 실행 가능한 동역학과 궤적 평가 기준이 해결된 모델에서 직접 상속되도록 하여 기존 생성 파이프라인에서 흔히 발생하는 정렬 문제를 해결합니다.
연구진은 SkillGym을 소개합니다. 이는 인간이 작성한 에이전트 기술을 대형 언어 모델 에이전트를 위한 실행 가능하고 검증 가능한 학습 환경으로 변환하는 프레임워크입니다. 이 시스템은 기술-작업 파이프라인을 활용하여 구체적인 작업을 인스턴스화하고 코드 기반 체크기로 결과를 검증합니다.
연구원들은 확장 가능한 데이터 구축과 모델 학습을 결합하여 범용 지시 기반 비디오 편집을 발전시키는 통합 프레임워크인 VideoX-Qwen을 제시했습니다. 이 시스템은 방향성 편집 레코드를 생성하기 위해 특수화된 모델을 조직하는 생산 파이프라인을 활용하며, 추가, 제거, 교체 및 속성 작업에 걸쳐 120만 개 이상의 고품질 샘플을 생성합니다.
Alibaba Cloud는 이전 오미 모델에 비해 멀티모달 이해와 추론을 크게 향상시키는 실세계 생산성 작업을 위해 설계된 네이티브 멀티모달 에이전트 모델인 Qwen3.8-Omni-Flash를 소개했습니다.
알리바바는 5조에서 10조 개의 매개변수를 포함하는 인공지능 모델을 개발할 계획을 발표했습니다. 이 로드맵과 함께 회사는 인프라 요구 사항을 지원하도록 설계된 새로운 맞춤형 칩도 공개했습니다.
알리바바의 Qwen 팀은 이전의 별도 체크포인트를 단일 7B 파라미터 디퓨전 트랜스포머로 통합한 텍스트-이미지 생성 및 이미지 편집용 통합 모델인 Qwen-Image-2.1을 출시했습니다.
Qwen은 이미지 생성 및 편집 모두를 위해 설계된 통합 모델인 오픈 웨이트 Qwen-Image-2.1을 출시했습니다.
알리바바 Qwen 팀은 실시간 화자를 들으며 화자가 말하는 동안 번역된 텍스트와 오디오를 반환하는 차세대 실시간 동시 통역 모델인 Qwen3.8-LiveTranslate를 출시했습니다. 이번 릴리스는 지연 시간을 줄이고 번역 품질을 향상시키기 위해 설계된 새로운 Interleave 아키텍처를 도입합니다.
알리바바는 암과 약 150개의 다른 의료 상태를 감지할 수 있는 오픈소스 의료 인공지능 모델을 출시했습니다.
Qwen3.8 Max (0902) 모델은 Artificial Analysis 지능 지수에서 45점을 달성하여 중국 리더보드에서 정상 자리를 되찾았습니다.
TRL v1.14는 AsyncGRPOTrainer에 LoRA 지원을 도입하여 Low-Rank Adaptation 어댑터를 학습하고 해당 작은 파일만 vLLM 추론 작업자에 동기화할 수 있게 합니다. 이 아키텍처는 공유 스토리지 버킷을 파일 시스템 브릿지로 사용하여 별도의 머신에서 학습 및 생성 작업을 분리함으로써 노드 간 NCCL 또는 직접 네트워크 통신의 필요성을 제거합니다.
연구는 "FragileTokens"를 특성화했는데, 이는 개방형 가중치 언어 모델의 어휘 항목으로, 고립되었을 때는 성공적으로 복사되지만 주변 텍스트에 삽입되면 오류를 보입니다. 이 연구는 표준 고립 테스트가 문자 그대로의 정체성 보존을 보장하지 않는다고 강조합니다. 시퀀스 내에서 토큰이 삭제, 대체 또는 잘릴 수 있기 때문입니다.
ExecCritic은 코딩 에이전트의 잘못된 자신감을 방지하기 위해 테스트 구성과 소스 코드 수리를 분리하는 프레임워크를 도입합니다. 이 시스템은 Qwen-3.5-35B-A3B로 구동되는 Test 에이전트와 Repair 에이전트를 사용하며, 두 에이전트는 각각 강화 학습을 통해 훈련됩니다.
연구자들은 테스트-검증-수정 스캐폴드와 역할별 강화 학습을 결합하여 코딩 에이전트를 향상시키는 프레임워크인 ExecCritic을 소개했다. 이 시스템은 테스트 구축과 소스 코드 수리를 분리하며, Test 에이전트는 저장소 네이티브 테스트를 생성하고 Repair 에이전트는 실행 피드백을 기반으로 코드를 수정한다.