ラボ · Alibaba (Qwen)
media MarkTechPost · 12日前 · 35 回表示

アリババのQwenが1Mコンテキストを持つエージェント型オムニモーダルモデル「Qwen3.8-Omni-Flash」をリリース

アリババのQwenチームは、音声・映像の理解とツール利用のためのエージェント機能を中核に設計された初のオムニモーダルモデルであるQwen3.8-Omni-Flashをリリースしました。このモデルはテキスト、画像、音声、動画の入力を受け取り、テキスト出力を返すもので、1Mトークンのコンテキストウィンドウとネイティブな関数呼び出し機能を備えています。

media MarkTechPost · 2日前 · 4 回表示

アリババのQwenチームが全二重音声モデル「Qwen-Audio-3.1-Realtime」をリリース

アリババのQwenチームは、新しいQwen-Audio-3.1-Realtime-plusを含む5つのモデルからなるオーディオスタックであるQwen-Audio-3.1をリリースしました。これは、推論やツール使用が可能な音声エージェント向けに設計された全二重音声モデルです。また、本リリースではASRサービスの料金が最大95%引き下げられました。

arxiv arXiv cs.AI · 2日前 · 1 回表示

RareDxはグラフ接地型ポリシー最適化を用いて希少疾患の診断を改善する

著者らは、希少疾患診断のロングテール推論問題に対処するため、制御された証拠利用と知識グラフ接地型ポリシー最適化を結合したシステムであるRareDxを紹介する。トレーニングパイプラインは、Top-10ポストトレーニングとRareDx-KGPOを組み合わせており、これは予測を標準的な疾患グラフに投影し、キュレーションされた段階的関連性、オントロジー近接性、生物医学的類似性、および表現型一貫性を統合する。

arxiv arXiv cs.CL · 2日前 · 1 回表示

Rep2ActはVAD-Rベンチマークにおける新規 abstention を改善するためにVLM表現を整合させる

研究者たちは、Vision Answerability Diagnosis with Rationales (VAD-R) を導入した。これは、ショートカットの手がかりなしに答えられない質問に対して回答を控えるビジョン言語モデルの能力を評価するために設計された新しいベンチマークである。本研究は、隠れ状態が回答可能性を区別できる一方で、現在のモデルはこの情報を明示的な意思決定に変換できないことを明らかにした。

arxiv arXiv cs.CL · 7日前 · 8 回表示

VHD-Playは解決されたメカニズムから自律型RL環境を生成する

VHD-Playは、数学的モデルのサンプリングと求解を経て、その意思決定プロセスを状態保持ツールとしてレンダリングすることで、多様な自律型強化学習環境を生成するパイプラインである。このアプローチにより、実行可能なダイナミクスや軌道スコアリングの参照が解決済みモデルから直接継承され、既存のパイプラインで一般的にみられる不整合の問題に対処する。

arxiv arXiv cs.CL · 7日前 SWE-Lancer · 51.47% · 10 回表示

SkillGymが人間のスキルをLLMに内部化し、現実世界の問題解決を実現

研究者らは、人間が記述したエージェントのスキルを実行可能で検証可能なトレーニング環境に変換するフレームワーク「SkillGym」を発表した。このシステムは、スキルからタスクへのパイプラインを活用して具体的なタスクをインスタンス化し、コードベースのチェッカーによって結果を検証する。

arxiv arXiv cs.AI · 8日前 · 17 回表示

VideoX-Qwenが指示ベースのビデオ編集のためのデータ中心フレームワークを導入

研究者らは、汎用かつ指示駆動のビデオ編集を推進するために、スケーラブルなデータ構築とモデル学習を組み合わせた統合フレームワークであるVideoX-Qwenを発表しました。このシステムは、方向性編集レコードを生成するために特殊化されたモデルを整理する生産パイプラインを利用し、追加、削除、置換、属性タスクにわたって120万以上の高品質サンプルをもたらします。

arxiv arXiv cs.CL · 8日前 · 19 回表示

Qwenが100万トークンコンテキストを備えたネイティブ多モーダルエージェントモデル「Qwen3.8-Omni-Flash」をリリース

Alibaba Cloudは、実世界の生産性タスク向けに設計されたネイティブな多モーダルエージェントモデルであるQwen3.8-Omni-Flashを発表しました。このモデルは、以前のオムニモデルと比較して、多モーダルな理解と推論を大幅に改善します。

media MarkTechPost · 11日前 · 28 回表示

アリババQwenチームがInterleaveアーキテクチャを採用したQwen3.8-LiveTranslateをリリース

アリババQwenチームは、リアルタイムの同時通訳モデルであるQwen3.8-LiveTranslateをリリースしました。このモデルは生音声を聴取し、話者がまだ話し続けている間に翻訳されたテキストと音声の両方を返します。今回のリリースでは、レイテンシを削減し翻訳品質を向上させるために設計された新しいInterleaveアーキテクチャが導入されました。

lab Hugging Face Blog · 17日前 · 19 回表示

TRL v1.14のAsyncGRPOTrainerがHugging Face Jobs間でLoRAのみを同期可能に

TRL v1.14は、AsyncGRPOTrainerにLoRAサポートを導入し、低ランク適応アダプタのトレーニングと、その小さなファイルのみをvLLM推論ワーカーへの同期を可能にします。このアーキテクチャは、共有ストレージバケットをファイルシステムブリッジとして使用することで、別々のマシン上のトレーニングジョブと生成ジョブを分離し、ノード間のNCCLや直接ネットワーク通信の必要性を排除します。

media Hugging Face Forums · 17日前 · 29 回表示

孤立プローブを通過しても文脈コピーに失敗する「FragileTokens」を特定した研究

ある研究は、「FragileTokens」と呼ばれる語彙項目を特徴づけている。これはオープンウェイト言語モデルにおける語彙エントリで、孤立した状態ではコピーに成功するが、周囲のテキスト中に埋め込まれるとエラーを示すものである。この研究は、標準的な孤立テストでは文字通りの同一性の保持が保証されないことを浮き彫りにしている。なぜなら、トークンはシーケンス内で削除されたり、置換されたり、切り詰められたりする可能性があるからである。

arxiv arXiv cs.AI · 22日前 SWE-bench Verified · 72.6% · 31 回表示

ExecCriticはロール固有のRLを用いてテスト誘導のリペアによりコーディングエージェントを改善する

ExecCriticは、コーディングエージェントにおける過信を防ぐため、テスト構築とソースコードリペアを分離するフレームワークを導入している。本システムは、Qwen-3.5-35B-A3BによってバックアップされたTestエージェントとRepairエージェントを採用し、それぞれ強化学習を用いて個別に訓練されている。

arxiv arXiv cs.CL · 22日前 SWE-bench Verified · 72.6% · 32 回表示

ExecCriticは役割固有のRLを用いてテスト誘導型修正によりコーディングエージェントを改善する

研究者たちは、テスト検証修正の枠組みと役割固有の強化学習を組み合わせてコーディングエージェントを強化するフレームワークであるExecCriticを紹介している。このシステムは、テスト構築とソースコードの修正を分離し、リポジトリネイティブなテストを生成するためにTestエージェントを用い、実行フィードバックに基づいてコードを書き直すためにRepairエージェントを用いる。