トピック · Image generation
lab Google — The Keyword (AI) · 21日前 · 41 回表示

Google DeepMindがドキュメンタリーのためにカップルの未記録の記憶をAIで再現

映画監督のLiz GarbusおよびPrimordial Soupとの協力により、Google DeepMindは短編ドキュメンタリー「Love, Rendered」のためにBurtとEthelle Shatzの撮影されていない出会いを再構築するために生成AIモデルを使用しました。このプロジェクトは、カップルの心の中にのみ存在していた特定の記憶を再現することで、認知機能の低下に対処しています。

arxiv arXiv cs.AI · 2日前 Multi-SWE-bench · 7.37% · 1 回表示

AutoRefがマルチリファレンス画像生成のためのエージェントハーネスを最適化

研究者らは、AutoRefを提案しました。これは、基盤モデルを凍結したまま、エージェントによるマルチリファレンス画像生成の実行ハーネスを自動的に最適化する手法です。コーディングエージェントは、被写体の省略や不自然な構成といった課題に対処するため、ハーネスコードを反復的に書き換えます。

media Hugging Face Forums · 3日前 · 4 回表示

Hung Tran氏、過学習ニューラル画像コーデックにおけるクリッピングの罠を特定

VNU-HCM(ホーチミン市情報技術大学)の修士課程学生であるHung Tran氏は、論文「The Clipping Trap: A Silent Failure Mode in Overfitted Neural Image Codecs」のコードとデータを公開した。この研究は、Cool-chicやC3のような過学習コーデックが、特定のコンテンツタイプにおいて歪み勾配がゼロの平坦な色画像を生成する仕組みを浮き彫りにしている。

media TLDR AI · 8日前 AIME 2024 · 50.0% · 16 回表示

MetaがMuseコネクタを公開、SAM 3.1をリリース、Geminiがシステムをハッキング

今回のアップデートでは、AIの動向として、Metaが自社のMuseプラットフォームをサードパーティ開発者に開放したこと、セグメンテーションモデルの新バージョンをリリースしたこと、GoogleのGeminiに関連するセキュリティインシデントなどが取り上げられています。

media Hugging Face Forums · 18日前 · 26 回表示

Badaramoniが混合LoRAとLoKRアダプターをマージしてKrea 2 TurboフォトリアリズムLoRAをリリース

Badaramoniは、異なる形式の公開リアリティパックを1つのファイルに結合するKrea-2-Turboモデル用の新しいアダプターをリリースしました。このリリースは、標準のマージャーツールが同じ低ランク形式を共有していないため、古典的なLoRAとLoKRアダプターを結合できないという制限に対処しています。

media Hugging Face Forums · 19日前 · 13 回表示

Diffusers-workflowがMCP経由でエージェントによるGPU画像・動画生成を可能にする

Diffusers-workflowは、Hugging Face Diffusersの上に構築された宣言型エンジンであり、大規模言語モデルのエージェントがPythonスクリプトの代わりにJSONドキュメントを使用して画像または動画のパイプラインを作成、検証、実行、および検査できるようにします。約50個のツールを備えたMCPサーバーを主要なインターフェースとして公開し、GPUリソースに対する無人のエージェント制御を可能にします。

lab Hugging Face Blog · 20日前 · 29 回表示

GradioがWorkflow1111をリリース、AUTOMATIC1111の機能をGradioグラフとして再構築

Gradioは、gr.Workflowフレームワークを使用してAUTOMATIC1111のstable-diffusion-webuiの機能セットの大部分を再構築したプロジェクトであるWorkflow1111をリリースしました。このアプリケーションは、73ノードから構築された11のメディアパイプラインを含む単一のキャンバスで構成されており、テキストから画像への変換、画像から動画への変換、および各種前処理タスクをカバーしています。

media r/LocalLLaMA · 21日前 · 35 回表示

gtrg55がINT4量子化されたNVIDIA Cosmos3 64Bをローカル画像生成用にリリース

あるユーザーが、INT4量子化を使用してNVIDIAの640億パラメータCosmos3モデルをローカルで実行するためのコードと重みを公開しました。この実装は、Apple Silicon上でのMLX経由およびCUDA上で、テキストから画像への変換と画像から動画への変換のタスクをサポートしています。

blog Simon Willison · 22日前 · 21 回表示

OpenAI、指示の追従性と参照写真の保持を改善した「ChatGPT Images 2.5」をリリース

OpenAIは、画像生成モデルのアップデートであるChatGPT Images 2.5をリリースしました。これにより、複数ターンにわたる指示の追従性が向上し、応答速度も向上します。新バージョンは、ユーザーが提供した参照写真から被写体を保持する能力も向上しています。

lab Hugging Face Blog · 28日前 · 33 回表示

OpenEnvがTRLを使ってSurya Narreddiの水彩画モデルを再現

エンジニアが、JavaScriptと強化学習を用いてコーディングモデルに水彩画を描かせるというSurya Narreddi氏の viral プロジェクトの再現版をオープンソースとして公開しました。この実装では、TRLライブラリとOpenEnvを活用し、Hugging Face上でトレーニング、スコアリング、推論を行うエンドツーエンドのパイプラインが構築されています。