xAIが正確な編集とレイアウト機能を備えたImagine Image 2.0をリリース
xAIは、新しいQualityモード、iOSアプリ、AndroidアプリとしてImagine Image 2.0の一般提供を開始した。このアップデートは、プロフェッショナルなクリエイティブワークフローのための精密な画像生成と編集に焦点を当てている。
xAIは、新しいQualityモード、iOSアプリ、AndroidアプリとしてImagine Image 2.0の一般提供を開始した。このアップデートは、プロフェッショナルなクリエイティブワークフローのための精密な画像生成と編集に焦点を当てている。
Nvidiaの研究者らは、物理的に妥当な照明転送とアイデンティティの保持、コンパクトなリアルタイム推論を組み合わせるポートレート再照明手法であるFusionRelightを導入した。このアプローチは、合成データ、One-Light-at-a-Time (OLAT)、および野外データから物理学、反射率、リアリティの事前知識を学生モデルに蒸留するトレーニングフレームワークであるハイブリッドドメイン知識融合(HDKF)を利用している。
研究者らは、ガウスプリミティブベースの画像圧縮におけるレート歪み性能を向上させるために設計されたCluster-Guided Vector Quantization (CGVQ)を発表します。このアプローチは、量子化の前にガウスパラメータを均質なグループに分割し、各プリミティブあたりの大量の浮動小数点パラメータの保存による非効率性を解決します。
NVIDIAは、インタラクティブなゲーム環境内で生成AIシステムを制御するという課題に対処するために設計されたフレームワークであるCTRL-G(Controllable Generative Graphics for Games)を発表しました。
Googleは3つの新モデルをリリースしました:効率的な汎用エージェントワークロード用のGemini 3.6 Flash、低遅延アプリケーション用の3.5 Flash-Lite、およびCodeMenderと統合されたサイバー専門の3.5 Flashモデル。
GoogleはarXivで入手可能なDiffusionGemmaの技術レポートを公開しました。この文書では、Gemmaファミリーの一部としてモデルのアーキテクチャと機能について詳細に説明されています。
DeepSeek v4 Flashモデルの初期テストでは、ユーザーインターフェースおよびユーザーエクスペリエンスデザインのスキルに顕著な改善が見られます。これらの改善にもかかわらず、このモデルはトークンを大量に消費することが指摘されています。
Kavramは、開発者がハードウェアを自分で管理せずにオープンな画像モデルを展開できるようにする、パイプライン分割型分散GPUネットワークを使用した本番用画像生成APIをテストしています。
Hugging Face Diffusersは、`from_pretrained()`経由でNunchaku Liteチェックポイントをネイティブに読み込む機能を追加し、個別の推論エンジンやローカルCUDAコンパイルの必要性を排除しました。この統合ではSVDQuant方式を用いて4ビット重みと活性化(W4A4)によるTransformerレイヤーを実行し、メモリ使用量を大幅に削減しつつ推論速度を向上させます。
Microsoftは、効率的なテキストから画像への生成および指示ベースの画像編集のために設計されたコンパクトな4Bスケールの生成スタックであるMage-Flowをリリースした。このシステムは、軽量トークナイザーMage-VAEとネイティブ解像度マルチモーダル拡散トランスフォーマー(NR-MMDiT)の共同設計により、最先端に匹敵する品質を実現している。
NVIDIAとHugging Faceは、NVIDIA NeMo Automodelを🤗 Diffusersライブラリと統合し、オープンソースの拡散モデルに対して本番環境対応の分散トレーニングを提供しました。この協力により、ユーザーはチェックポイントの変換やモデルコードの書き換えを行うことなく、Hugging Face Hub上のDiffusers形式のモデルをファインチューニングできます。
Hugging Faceフォーラムのユーザーは、FireRed Image Edit v1.1モデルに対するINT8またはFP8のConvRot版の開発の可能性について質問しています。
Hugging Faceのディスカッションフォーラムのユーザーが、toyxyzが投稿した比較画像で「図B」に使用されている特定のアーティストタグをコミュニティに特定してほしいと依頼しています。