トピック · Image generation
lab NVIDIA Research · 3時間前 · 2 回表示

Nvidia、ハイブリッドドメイン知識融合によるリアルタイムポートレート再照明手法「FusionRelight」を発表

Nvidiaの研究者らは、物理的に妥当な照明転送とアイデンティティの保持、コンパクトなリアルタイム推論を組み合わせるポートレート再照明手法であるFusionRelightを導入した。このアプローチは、合成データ、One-Light-at-a-Time (OLAT)、および野外データから物理学、反射率、リアリティの事前知識を学生モデルに蒸留するトレーニングフレームワークであるハイブリッドドメイン知識融合(HDKF)を利用している。

lab NVIDIA Research · 18日前 · 13 回表示

2Dガウスベース画像圧縮のためのクラスター化コードブック量子化

研究者らは、ガウスプリミティブベースの画像圧縮におけるレート歪み性能を向上させるために設計されたCluster-Guided Vector Quantization (CGVQ)を発表します。このアプローチは、量子化の前にガウスパラメータを均質なグループに分割し、各プリミティブあたりの大量の浮動小数点パラメータの保存による非効率性を解決します。

lab Hugging Face Blog · 23日前 · 3 回表示

DiffusersがNunchaku Liteの4ビット推論をネイティブサポート

Hugging Face Diffusersは、`from_pretrained()`経由でNunchaku Liteチェックポイントをネイティブに読み込む機能を追加し、個別の推論エンジンやローカルCUDAコンパイルの必要性を排除しました。この統合ではSVDQuant方式を用いて4ビット重みと活性化(W4A4)によるTransformerレイヤーを実行し、メモリ使用量を大幅に削減しつつ推論速度を向上させます。

media r/LocalLLaMA · 23日前 · 6 回表示

Microsoftが画像生成・編集用の4Bネイティブ解像度モデル「Mage-Flow」をリリース

Microsoftは、効率的なテキストから画像への生成および指示ベースの画像編集のために設計されたコンパクトな4Bスケールの生成スタックであるMage-Flowをリリースした。このシステムは、軽量トークナイザーMage-VAEとネイティブ解像度マルチモーダル拡散トランスフォーマー(NR-MMDiT)の共同設計により、最先端に匹敵する品質を実現している。

lab Hugging Face Blog · 28日前 · 5 回表示

NVIDIA NeMo AutomodelがHugging Face Diffusersと連携し、分散型拡散モデルのファインチューニングを実現

NVIDIAとHugging Faceは、NVIDIA NeMo Automodelを🤗 Diffusersライブラリと統合し、オープンソースの拡散モデルに対して本番環境対応の分散トレーニングを提供しました。この協力により、ユーザーはチェックポイントの変換やモデルコードの書き換えを行うことなく、Hugging Face Hub上のDiffusers形式のモデルをファインチューニングできます。