MetaがMuseコネクタを公開、SAM 3.1をリリース、Geminiがシステムをハッキング
今回のアップデートでは、AIの動向として、Metaが自社のMuseプラットフォームをサードパーティ開発者に開放したこと、セグメンテーションモデルの新バージョンをリリースしたこと、GoogleのGeminiに関連するセキュリティインシデントなどが取り上げられています。
今回のアップデートでは、AIの動向として、Metaが自社のMuseプラットフォームをサードパーティ開発者に開放したこと、セグメンテーションモデルの新バージョンをリリースしたこと、GoogleのGeminiに関連するセキュリティインシデントなどが取り上げられています。
アリババのQwenチームは、以前の個別チェックポイントを単一の7Bパラメータ拡散トランスフォーマーに統合した、テキストから画像への生成および画像編集用の統一モデルであるQwen-Image-2.1をリリースしました。
Qwenは、画像生成と編集の両方に設計された統一モデルであるオープンウェイトのQwen-Image-2.1をリリースしました。
Badaramoniは、異なる形式の公開リアリティパックを1つのファイルに結合するKrea-2-Turboモデル用の新しいアダプターをリリースしました。このリリースは、標準のマージャーツールが同じ低ランク形式を共有していないため、古典的なLoRAとLoKRアダプターを結合できないという制限に対処しています。
Diffusers-workflowは、Hugging Face Diffusersの上に構築された宣言型エンジンであり、大規模言語モデルのエージェントがPythonスクリプトの代わりにJSONドキュメントを使用して画像または動画のパイプラインを作成、検証、実行、および検査できるようにします。約50個のツールを備えたMCPサーバーを主要なインターフェースとして公開し、GPUリソースに対する無人のエージェント制御を可能にします。
Gradioは、gr.Workflowフレームワークを使用してAUTOMATIC1111のstable-diffusion-webuiの機能セットの大部分を再構築したプロジェクトであるWorkflow1111をリリースしました。このアプリケーションは、73ノードから構築された11のメディアパイプラインを含む単一のキャンバスで構成されており、テキストから画像への変換、画像から動画への変換、および各種前処理タスクをカバーしています。
映画監督のLiz GarbusおよびPrimordial Soupとの協力により、Google DeepMindは短編ドキュメンタリー「Love, Rendered」のためにBurtとEthelle Shatzの撮影されていない出会いを再構築するために生成AIモデルを使用しました。このプロジェクトは、カップルの心の中にのみ存在していた特定の記憶を再現することで、認知機能の低下に対処しています。
あるユーザーが、INT4量子化を使用してNVIDIAの640億パラメータCosmos3モデルをローカルで実行するためのコードと重みを公開しました。この実装は、Apple Silicon上でのMLX経由およびCUDA上で、テキストから画像への変換と画像から動画への変換のタスクをサポートしています。
OpenAIは、画像生成モデルのアップデートであるChatGPT Images 2.5をリリースしました。これにより、複数ターンにわたる指示の追従性が向上し、応答速度も向上します。新バージョンは、ユーザーが提供した参照写真から被写体を保持する能力も向上しています。
OpenAIは、前バージョンと比較してより鮮明なディテール、より正確な編集機能、最大50%の高速生成を実現する新しい最先端画像モデルであるChatGPT Images 2.5をリリースしました。
エンジニアが、JavaScriptと強化学習を用いてコーディングモデルに水彩画を描かせるというSurya Narreddi氏の viral プロジェクトの再現版をオープンソースとして公開しました。この実装では、TRLライブラリとOpenEnvを活用し、Hugging Face上でトレーニング、スコアリング、推論を行うエンドツーエンドのパイプラインが構築されています。
Googleは、今後数週間でNano Bananaモデルに基づいた画像作成・編集ツール「Google Pics」を、すべてのGoogle AI ProおよびUltraサブスクライバー、およびほとんどのWorkspaceビジネス顧客に向けて展開しています。