Image generation
media TLDR AI · 2時間前 AIME 2024 · 50.0% · 9 回表示

MetaがMuseコネクタを公開、SAM 3.1をリリース、Geminiがシステムをハッキング

今回のアップデートでは、AIの動向として、Metaが自社のMuseプラットフォームをサードパーティ開発者に開放したこと、セグメンテーションモデルの新バージョンをリリースしたこと、GoogleのGeminiに関連するセキュリティインシデントなどが取り上げられています。

media Hugging Face Forums · 11日前 · 18 回表示

Badaramoniが混合LoRAとLoKRアダプターをマージしてKrea 2 TurboフォトリアリズムLoRAをリリース

Badaramoniは、異なる形式の公開リアリティパックを1つのファイルに結合するKrea-2-Turboモデル用の新しいアダプターをリリースしました。このリリースは、標準のマージャーツールが同じ低ランク形式を共有していないため、古典的なLoRAとLoKRアダプターを結合できないという制限に対処しています。

media Hugging Face Forums · 11日前 · 9 回表示

Diffusers-workflowがMCP経由でエージェントによるGPU画像・動画生成を可能にする

Diffusers-workflowは、Hugging Face Diffusersの上に構築された宣言型エンジンであり、大規模言語モデルのエージェントがPythonスクリプトの代わりにJSONドキュメントを使用して画像または動画のパイプラインを作成、検証、実行、および検査できるようにします。約50個のツールを備えたMCPサーバーを主要なインターフェースとして公開し、GPUリソースに対する無人のエージェント制御を可能にします。

lab Hugging Face Blog · 13日前 · 24 回表示

GradioがWorkflow1111をリリース、AUTOMATIC1111の機能をGradioグラフとして再構築

Gradioは、gr.Workflowフレームワークを使用してAUTOMATIC1111のstable-diffusion-webuiの機能セットの大部分を再構築したプロジェクトであるWorkflow1111をリリースしました。このアプリケーションは、73ノードから構築された11のメディアパイプラインを含む単一のキャンバスで構成されており、テキストから画像への変換、画像から動画への変換、および各種前処理タスクをカバーしています。

lab Google — The Keyword (AI) · 14日前 · 36 回表示

Google DeepMindがドキュメンタリーのためにカップルの未記録の記憶をAIで再現

映画監督のLiz GarbusおよびPrimordial Soupとの協力により、Google DeepMindは短編ドキュメンタリー「Love, Rendered」のためにBurtとEthelle Shatzの撮影されていない出会いを再構築するために生成AIモデルを使用しました。このプロジェクトは、カップルの心の中にのみ存在していた特定の記憶を再現することで、認知機能の低下に対処しています。

media r/LocalLLaMA · 14日前 · 30 回表示

gtrg55がINT4量子化されたNVIDIA Cosmos3 64Bをローカル画像生成用にリリース

あるユーザーが、INT4量子化を使用してNVIDIAの640億パラメータCosmos3モデルをローカルで実行するためのコードと重みを公開しました。この実装は、Apple Silicon上でのMLX経由およびCUDA上で、テキストから画像への変換と画像から動画への変換のタスクをサポートしています。

blog Simon Willison · 14日前 · 18 回表示

OpenAI、指示の追従性と参照写真の保持を改善した「ChatGPT Images 2.5」をリリース

OpenAIは、画像生成モデルのアップデートであるChatGPT Images 2.5をリリースしました。これにより、複数ターンにわたる指示の追従性が向上し、応答速度も向上します。新バージョンは、ユーザーが提供した参照写真から被写体を保持する能力も向上しています。

lab Hugging Face Blog · 20日前 · 29 回表示

OpenEnvがTRLを使ってSurya Narreddiの水彩画モデルを再現

エンジニアが、JavaScriptと強化学習を用いてコーディングモデルに水彩画を描かせるというSurya Narreddi氏の viral プロジェクトの再現版をオープンソースとして公開しました。この実装では、TRLライブラリとOpenEnvを活用し、Hugging Face上でトレーニング、スコアリング、推論を行うエンドツーエンドのパイプラインが構築されています。