トピック · Open weights
lab Microsoft Research Blog · 9日前 · 62 回表示

Microsoft、逆合成予測用のRetroChimeraをリリース

Microsoft Researchは、逆合成予測のための新しいフレームワークであるRetroChimeraを公開し、オープンソース化した。このフレームワークは2つの補完的なモデルを組み合わせて、高品質な合成経路を提案する。システムは、TransformerベースのデノボモデルであるR-SMILES 2と、グラフニューラルネットワーク(GNN)ベースのモデルであるNeuralLocを、学習されたアンサンブル戦略を用いて統合し、予測結果をランク付けする。

lab Google DeepMind Blog · 22日前 · 39 回表示

Google DeepMind、すべてのヒトDNA変異に対するAlphaGenome Atlasを公開

Google DeepMindは、ヒトゲノム全体にわたる90億個の単一ヌクレオチド多型(SNV)の影響に関する予測を含むプラットフォーム「AlphaGenome Atlas」を公開した。このリソースは、遺伝的変異が分子生物学に与える影響の包括的なマッピングを提供することで、生物学的理解の加速を目指している。

lab Hugging Face Blog · 1日前 · 8 回表示

NVIDIAがゼロショット表形式予測用のオープンなKumo Tabularファウンデーションモデルをリリース

NVIDIAは、トレーニングや特徴エンジニアリングを必要とせず、コンテキスト内学習を通じて動作する表形式の分類および回帰用のオープンなファウンデーションモデルであるKumo Tabularをリリースした。構造化因果モデルによって生成された人工データのみで事前学習されており、28Mから215Mパラメータの3つのサイズで提供されている。

lab Hugging Face Blog · 2日前 OSWorld 2.0 · 61.7% · 9 回表示

Holo4: GUI、コード、API向けの汎用エージェントモデル

Holo4は、H社による新しいエージェントモデルシリーズで、27BのDenseと35B-A3BのMixture of Expertsサイズが利用可能です。これらのモデルは、GUI、コード、MCP、APIを含むあらゆるインターフェースを通じてソフトウェアと対話し、同じモデルを使用してデスクトップ、Web、Android、およびサンドボックス上で動作します。

media AI News (smol.ai) · 18日前 · 51 回表示

DeepSeekが極限の推論効率に焦点を当てたオープンウェイトモデルV4.1-Flashをリリース

DeepSeekは、極限の推論効率と低コストを実現するために設計された新しいオープンウェイトのフラッグシップモデルであるV4.1-Flashをリリースしました。このモデルは、アクティブな計算量とKV/キャッシュのコストを大幅に削減するために、因果的なエンコーダ・デコーダアーキテクチャを利用しています。

media MarkTechPost · 20日前 · 55 回表示

DeepSeekが1MコンテキストとFP4 KVキャッシュを搭載したDeepSeek-V4.1-Flashをリリース

DeepSeek AIは、100万トークンのコンテキストウィンドウと、グローバルキャッシュのフットプリントをトークンあたり890バイトに削減するFP4 KVキャッシュを備えたマルチモーダルMixture-of-ExpertsモデルであるDeepSeek-V4.1-Flashをリリースしました。このモデルは、因果的なエンコーダ・デコーダアーキテクチャとCompressed Sparse Attention 2 (CSA2) を活用し、パフォーマンスを維持しながらメモリ要件を大幅に削減しています。

media MarkTechPost · 1日前 Android World · 85.1% · 8 回表示

H社がデスクトップ、Web、モバイル向けのHolo4オープンウェイトコンピュータ操作モデルをリリース

H社は、デスクトップ、Web、Android、API環境でクリック、入力、コード記述、ツール呼び出しを行うために設計された汎用コンピュータ操作ビジョン言語モデルのファミリーであるHolo4をリリースした。今回のリリースには2つのモデルサイズが含まれる:Holo4 27B(デンス)とHolo4 35B-A3B(エキスパート混合、アクティブパラメータ3B)。どちらも256Kのコンテキストウィンドウをサポートする。

media MarkTechPost · 1日前 SWE-bench Verified · 79.0% · 7 回表示

Google Research、AIエージェントのハーネス過学習を防ぐRRSIを公開

Google Cloud AI Researchは、UNCチャペルヒル校、スタンフォード大学、ワシントン大学セントルイス校と共同で、RRSI(Regularized Recursive Self-Improvement)をオープンソース化した。このフレームワークにより、LLMエージェントはモデルの重みを変更せずに、プロンプト、ツール、メモリ、制御フロー、サブエージェントを含む自身のハーネスを書き換えることができる。

media r/LocalLLaMA · 1日前 · 3 回表示

IQuestLabがエージェント型コーディング用の320B MoEモデル「IQuest-Q1」をリリース

IQuestは、エージェント型コーディング、推論、マルチステップツール使用のために設計されたMixture-of-Experts (MoE)モデルであるIQuest-Q1をリリースしました。 このモデルは約3200億の総パラメータを持ち、トークンあたり約150億のパラメータが活性化されます。 Hugging Faceで利用可能です。

media Hugging Face Forums · 2日前 · 4 回表示

NewTypeColaが66,010ページの韓国語VOKUアーカイブデータセットをリリース

NewTypeColaはHugging FaceにVOKU Archiveを公開しました。これは韓国の学生運営のキャンパスラジオ放送キューシート(cue sheets)から収集した66,010ページのスキャン画像コレクションです。文書は1988年から2019年まで spanning し、OCRテキスト、擬名トークン注釈、メタデータを含みます。

media Hugging Face Forums · 6日前 GPQA Diamond · 93.94% · 22 回表示

VeriLoop E2: BF16からIQ1_MまでのGGUFラダーを持つ27Bポストトレーニングモデル

清華大学SIGSロボットラボは、検証可能なコード、数学、科学推論のためにQwen3.8-27Bを基盤とした27BポストトレーニングモデルであるVeriLoop E2をリリースしました。今回のリリースでは、生成と外部検証を分離し、状態遷移が証拠次元を厳密に改善することを保証するVeriLoop-Governed Recurrence (VGR) が導入されました。

media MarkTechPost · 7日前 · 16 回表示

NVIDIAが8人の話者を追跡する1億パラメータのモデル「Nemotron 3 Diarization」をリリース

NVIDIAは、Hugging FaceでOpenMDWライセンス1.1の下で公開されているオープンウェイトの話者 diarization モデル「Nemotron 3 Diarization」をリリースしました。この1億パラメータのモデルは、単一のチェックポイントを使用して、リアルタイムまたはオフラインモードで最大8人の重なり合う話者を追跡します。

media r/LocalLLaMA · 7日前 · 43 回表示

AppleがLensVLM-9Bをリリース、圧縮されたテキスト画像を選択的に拡張するVLM

Appleは、テキストの圧縮画像をより効率的に処理するために設計された90億パラメータのVision Language ModelであるLensVLM-9Bをリリースしました。このモデルはこれらの圧縮入力をスキャンし、学習したツールを使用して関連するページのみを選択的に非圧縮形式に拡張します。