米国でオープンウェイトモデルを開発するArceeは、エネルギー省と提携してGenesis-Science-1を作成しました。この協力により、科学研究用に特別に設計されたオープンモデルが生まれました。
Arceeとエネルギー省がGenesis-Science-1の構築でパートナーシップを締結
Arcee AIとDOEが科学調査用の1Tオープンウェイトモデル「Genesis-Science-1」を発表
米国エネルギー省(DOE)とArcee AIは、科学調査のために特別に設計されたオープンウェイト言語モデルであるGenesis-Science-1 (GS1)の開発を発表した。この取り組みはジェネシスミッションの一環であり、政府機関と民間企業の共同作業を通じて、広範な科学分野に高度なAIの能力をもたらすことを目的としている。
Tencentがチャンク単位スパース注意機構を持つHiLS-Attention-7Bをリリース
Tencentは、OLMo3スタイルのバックボーンに基づいて構築された70億パラメータのモデルであるHiLS-Attention-7Bチェックポイントをリリースしました。このモデルは、言語モデリング損失の下でチャンク選択をエンドツーエンドで学習するチャンク単位スパース注意機構を実装しています。
DiaLLMは英語方言適応における堅牢性-生成ギャップを調査
DiaLLMの研究は、国際コーパス・オブ・イングリッシュにおいて3つのオープンウェイト言語モデルファミリーに対して継続的プリトレーニングを行うことで、方言理解と生成の間の断絶に対処する。オーストラリア英語、インド英語、北部イギリス英語を比較するために、暗黙的および明示的なポストトレーニングのパラダイムに3つのアライメント戦略を組み合わせて適用する。
DiaLLMは英語方言適応における堅牢性-生成ギャップを調査
DiaLLMの研究により、大規模言語モデルにおいて方言的堅牢性と生成は解離しており、継続的事前学習によって形成されたベンチマークは、アライメントが実際の出力をどのように再形成するかを捉えていないことが明らかになった。著者は、International Corpus of English上で3つのオープンウェイトモデルファミリーに対して継続的事前学習を適用し、オーストラリア英語、インド英語、北英英語に対して暗黙的および明示的なポストトレーニングパラダイムと3つのアライメント戦略を組み合わせた。\n\n- 明示的なバリエーションターゲット適応は、方言的として確実に認識され、広範なアライメントよりも好まれる出力を生み出す。
QllmがKVキャッシュなしのO(1)推論モデルをリリース
研究者が、キーバリュー(KV)キャッシュの必要性を排除することでO(1)の推論時間を実現する新しい大規模言語モデルアーキテクチャであるQllmをリリースしました。100Mパラメータのこのモデルは位相結合性に基づいて構築されており、トランスフォーマーやmambaの構造には依存していません。