アリババ、Apsara ConferenceでQwen 4を発表
アリババはApsara Conferenceの間、Qwen 4のリリースを正式に発表しました。
アリババはApsara Conferenceの間、Qwen 4のリリースを正式に発表しました。
アリババのQwenチームは、音声・映像の理解とツール利用のためのエージェント機能を中核に設計された初のオムニモーダルモデルであるQwen3.8-Omni-Flashをリリースしました。このモデルはテキスト、画像、音声、動画の入力を受け取り、テキスト出力を返すもので、1Mトークンのコンテキストウィンドウとネイティブな関数呼び出し機能を備えています。
アリババのQwenチームは、新しいQwen-Audio-3.1-Realtime-plusを含む5つのモデルからなるオーディオスタックであるQwen-Audio-3.1をリリースしました。これは、推論やツール使用が可能な音声エージェント向けに設計された全二重音声モデルです。また、本リリースではASRサービスの料金が最大95%引き下げられました。
ISTAディープアルゴリズム&システムラボは、スパース混合ExpertsモデルQwen3.8-Flash-Nextの量子化GGUF版と、そのExpertsの半分を削除した実験的な能力特化ビルドをリリースしました。
著者らは、希少疾患診断のロングテール推論問題に対処するため、制御された証拠利用と知識グラフ接地型ポリシー最適化を結合したシステムであるRareDxを紹介する。トレーニングパイプラインは、Top-10ポストトレーニングとRareDx-KGPOを組み合わせており、これは予測を標準的な疾患グラフに投影し、キュレーションされた段階的関連性、オントロジー近接性、生物医学的類似性、および表現型一貫性を統合する。
研究者たちは、Vision Answerability Diagnosis with Rationales (VAD-R) を導入した。これは、ショートカットの手がかりなしに答えられない質問に対して回答を控えるビジョン言語モデルの能力を評価するために設計された新しいベンチマークである。本研究は、隠れ状態が回答可能性を区別できる一方で、現在のモデルはこの情報を明示的な意思決定に変換できないことを明らかにした。
VHD-Playは、数学的モデルのサンプリングと求解を経て、その意思決定プロセスを状態保持ツールとしてレンダリングすることで、多様な自律型強化学習環境を生成するパイプラインである。このアプローチにより、実行可能なダイナミクスや軌道スコアリングの参照が解決済みモデルから直接継承され、既存のパイプラインで一般的にみられる不整合の問題に対処する。
研究者らは、人間が記述したエージェントのスキルを実行可能で検証可能なトレーニング環境に変換するフレームワーク「SkillGym」を発表した。このシステムは、スキルからタスクへのパイプラインを活用して具体的なタスクをインスタンス化し、コードベースのチェッカーによって結果を検証する。
研究者らは、汎用かつ指示駆動のビデオ編集を推進するために、スケーラブルなデータ構築とモデル学習を組み合わせた統合フレームワークであるVideoX-Qwenを発表しました。このシステムは、方向性編集レコードを生成するために特殊化されたモデルを整理する生産パイプラインを利用し、追加、削除、置換、属性タスクにわたって120万以上の高品質サンプルをもたらします。
Alibaba Cloudは、実世界の生産性タスク向けに設計されたネイティブな多モーダルエージェントモデルであるQwen3.8-Omni-Flashを発表しました。このモデルは、以前のオムニモデルと比較して、多モーダルな理解と推論を大幅に改善します。
アリババは、5兆から10兆のパラメータを含む人工知能モデルを開発する計画を発表しました。このロードマップに伴い、同社はインフラストラクチャのニーズをサポートするために設計された新しいカスタムチップも発表しました。
アリババのQwenチームは、以前の個別チェックポイントを単一の7Bパラメータ拡散トランスフォーマーに統合した、テキストから画像への生成および画像編集用の統一モデルであるQwen-Image-2.1をリリースしました。
Qwenは、画像生成と編集の両方に設計された統一モデルであるオープンウェイトのQwen-Image-2.1をリリースしました。
アリババQwenチームは、リアルタイムの同時通訳モデルであるQwen3.8-LiveTranslateをリリースしました。このモデルは生音声を聴取し、話者がまだ話し続けている間に翻訳されたテキストと音声の両方を返します。今回のリリースでは、レイテンシを削減し翻訳品質を向上させるために設計された新しいInterleaveアーキテクチャが導入されました。
アリババは、がんと約150の他の医療状態を検出できるオープンソースの医療人工知能モデルをリリースしました。
Qwen3.8 Max (0902)モデルは、Artificial Analysisインテリジェンス指数で45点を達成し、中国のリーダーボードでトップの座を奪還しました。
TRL v1.14は、AsyncGRPOTrainerにLoRAサポートを導入し、低ランク適応アダプタのトレーニングと、その小さなファイルのみをvLLM推論ワーカーへの同期を可能にします。このアーキテクチャは、共有ストレージバケットをファイルシステムブリッジとして使用することで、別々のマシン上のトレーニングジョブと生成ジョブを分離し、ノード間のNCCLや直接ネットワーク通信の必要性を排除します。
ある研究は、「FragileTokens」と呼ばれる語彙項目を特徴づけている。これはオープンウェイト言語モデルにおける語彙エントリで、孤立した状態ではコピーに成功するが、周囲のテキスト中に埋め込まれるとエラーを示すものである。この研究は、標準的な孤立テストでは文字通りの同一性の保持が保証されないことを浮き彫りにしている。なぜなら、トークンはシーケンス内で削除されたり、置換されたり、切り詰められたりする可能性があるからである。
ExecCriticは、コーディングエージェントにおける過信を防ぐため、テスト構築とソースコードリペアを分離するフレームワークを導入している。本システムは、Qwen-3.5-35B-A3BによってバックアップされたTestエージェントとRepairエージェントを採用し、それぞれ強化学習を用いて個別に訓練されている。
研究者たちは、テスト検証修正の枠組みと役割固有の強化学習を組み合わせてコーディングエージェントを強化するフレームワークであるExecCriticを紹介している。このシステムは、テスト構築とソースコードの修正を分離し、リポジトリネイティブなテストを生成するためにTestエージェントを用い、実行フィードバックに基づいてコードを書き直すためにRepairエージェントを用いる。