Image generation
lab NVIDIA Research · 12日前 · 8 回表示

2Dガウスベース画像圧縮のためのクラスター化コードブック量子化

研究者らは、ガウスプリミティブベースの画像圧縮におけるレート歪み性能を向上させるために設計されたCluster-Guided Vector Quantization (CGVQ)を発表します。このアプローチは、量子化の前にガウスパラメータを均質なグループに分割し、各プリミティブあたりの大量の浮動小数点パラメータの保存による非効率性を解決します。

lab Hugging Face Blog · 17日前 · 2 回表示

DiffusersがNunchaku Liteの4ビット推論をネイティブサポート

Hugging Face Diffusersは、`from_pretrained()`経由でNunchaku Liteチェックポイントをネイティブに読み込む機能を追加し、個別の推論エンジンやローカルCUDAコンパイルの必要性を排除しました。この統合ではSVDQuant方式を用いて4ビット重みと活性化(W4A4)によるTransformerレイヤーを実行し、メモリ使用量を大幅に削減しつつ推論速度を向上させます。

media r/LocalLLaMA · 17日前 · 5 回表示

Microsoftが画像生成・編集用の4Bネイティブ解像度モデル「Mage-Flow」をリリース

Microsoftは、効率的なテキストから画像への生成および指示ベースの画像編集のために設計されたコンパクトな4Bスケールの生成スタックであるMage-Flowをリリースした。このシステムは、軽量トークナイザーMage-VAEとネイティブ解像度マルチモーダル拡散トランスフォーマー(NR-MMDiT)の共同設計により、最先端に匹敵する品質を実現している。

lab Hugging Face Blog · 23日前 · 5 回表示

NVIDIA NeMo AutomodelがHugging Face Diffusersと連携し、分散型拡散モデルのファインチューニングを実現

NVIDIAとHugging Faceは、NVIDIA NeMo Automodelを🤗 Diffusersライブラリと統合し、オープンソースの拡散モデルに対して本番環境対応の分散トレーニングを提供しました。この協力により、ユーザーはチェックポイントの変換やモデルコードの書き換えを行うことなく、Hugging Face Hub上のDiffusers形式のモデルをファインチューニングできます。

arxiv arXiv cs.AI · 26日前 · 1 回表示

CtrlVTONはビジュアルインスタンスプロンプトセグメンテーションにより制御可能なバーチャル試着を実現

著者らは、CtrlVTONというフレームワークを発表しました。これは、バーチャル試着におけるユーザー操作の不足に対処するため、タスクをピクセルレベルのセグメンテーションマスクを用いた画像編集として再定義するものです。このアプローチにより、ユーザーは衣類のサイズ、スタイル、身体への配置位置を指定できます。

media Hugging Face Forums · 28日前

HoLo-FuSeは0パラメータのHSL基盤を用いたクラス条件付き画像生成

HoLo-FuSeは、凍結されたゼロパラメータのHoLo Semantic Layer (HSL) バイト基盤が、画像生成のための拡散モデルを効果的に条件付けできることを実証した。このプロジェクトは、この決定論的な27-D特徴フレームが、従来の学習済み埋め込みの代わりにクラス条件付きDDPMの条件付けメカニズムとして機能できるかどうかを検証している。

media r/LocalLLaMA · 28日前 · 3 回表示

ZimengXiongがHunyuan3DをApple SiliconとiPhone向けにMLXへポート

開発者のZimengXiongは、Hunyuan3D-PaintおよびHunyuan3D-ShapeモデルのSwift-MLXおよびPython MLXへのポートを完了し、Apple Siliconデバイスでのローカルな画像から3Dへの生成を可能にしました。この取り組みは、macOSおよびiOS向けのオープンソースModelrデスクトップアプリとして配布されており、Swiftアプリケーションへの技術統合のためのソースコードも含まれています。

media r/LocalLLaMA · 29日前

Fabricio3gがFlaxeo Imageをリリース、stable diffusion cpp用のローカルデスクトップUI

Fabricio3gは、最近のsd.cppリリースを中心に構築されたローカルデスクトップユーザーインターフェースであるFlaxeo Imageをリリースしました。このアプリケーションは、生成、編集、動画パス、モデル管理、ハードウェアオプションなど、バックエンドの機能の大部分を公開することを目指しています。