xAIが正確な編集とレイアウト機能を備えたImagine Image 2.0をリリース
xAIは、新しいQualityモード、iOSアプリ、AndroidアプリとしてImagine Image 2.0の一般提供を開始した。このアップデートは、プロフェッショナルなクリエイティブワークフローのための精密な画像生成と編集に焦点を当てている。
xAIは、新しいQualityモード、iOSアプリ、AndroidアプリとしてImagine Image 2.0の一般提供を開始した。このアップデートは、プロフェッショナルなクリエイティブワークフローのための精密な画像生成と編集に焦点を当てている。
DeepSeek v4 Flashモデルの初期テストでは、ユーザーインターフェースおよびユーザーエクスペリエンスデザインのスキルに顕著な改善が見られます。これらの改善にもかかわらず、このモデルはトークンを大量に消費することが指摘されています。
研究者らは、ガウスプリミティブベースの画像圧縮におけるレート歪み性能を向上させるために設計されたCluster-Guided Vector Quantization (CGVQ)を発表します。このアプローチは、量子化の前にガウスパラメータを均質なグループに分割し、各プリミティブあたりの大量の浮動小数点パラメータの保存による非効率性を解決します。
Kavramは、開発者がハードウェアを自分で管理せずにオープンな画像モデルを展開できるようにする、パイプライン分割型分散GPUネットワークを使用した本番用画像生成APIをテストしています。
Hugging Face Diffusersは、`from_pretrained()`経由でNunchaku Liteチェックポイントをネイティブに読み込む機能を追加し、個別の推論エンジンやローカルCUDAコンパイルの必要性を排除しました。この統合ではSVDQuant方式を用いて4ビット重みと活性化(W4A4)によるTransformerレイヤーを実行し、メモリ使用量を大幅に削減しつつ推論速度を向上させます。
Microsoftは、効率的なテキストから画像への生成および指示ベースの画像編集のために設計されたコンパクトな4Bスケールの生成スタックであるMage-Flowをリリースした。このシステムは、軽量トークナイザーMage-VAEとネイティブ解像度マルチモーダル拡散トランスフォーマー(NR-MMDiT)の共同設計により、最先端に匹敵する品質を実現している。
NVIDIAは、インタラクティブなゲーム環境内で生成AIシステムを制御するという課題に対処するために設計されたフレームワークであるCTRL-G(Controllable Generative Graphics for Games)を発表しました。
Googleは3つの新モデルをリリースしました:効率的な汎用エージェントワークロード用のGemini 3.6 Flash、低遅延アプリケーション用の3.5 Flash-Lite、およびCodeMenderと統合されたサイバー専門の3.5 Flashモデル。
Hugging Faceのディスカッションフォーラムのユーザーが、toyxyzが投稿した比較画像で「図B」に使用されている特定のアーティストタグをコミュニティに特定してほしいと依頼しています。
NVIDIAとHugging Faceは、NVIDIA NeMo Automodelを🤗 Diffusersライブラリと統合し、オープンソースの拡散モデルに対して本番環境対応の分散トレーニングを提供しました。この協力により、ユーザーはチェックポイントの変換やモデルコードの書き換えを行うことなく、Hugging Face Hub上のDiffusers形式のモデルをファインチューニングできます。
Hugging Faceフォーラムのユーザーは、FireRed Image Edit v1.1モデルに対するINT8またはFP8のConvRot版の開発の可能性について質問しています。
Simon Willison氏は、OpenAIのGPT-5.6 Solモデルとgpt-image-2 APIを活用して、Codex Desktopアプリケーションのカスタムアニメーション「ペット」を作成する方法を実演します。
設立25周年を記念して、GoogleはGoogle Imagesの再設計された閲覧可能なホームと、AI Overviews内での新しい画像生成機能を発表しました。
著者らは、CtrlVTONというフレームワークを発表しました。これは、バーチャル試着におけるユーザー操作の不足に対処するため、タスクをピクセルレベルのセグメンテーションマスクを用いた画像編集として再定義するものです。このアプローチにより、ユーザーは衣類のサイズ、スタイル、身体への配置位置を指定できます。
HoLo-FuSeは、凍結されたゼロパラメータのHoLo Semantic Layer (HSL) バイト基盤が、画像生成のための拡散モデルを効果的に条件付けできることを実証した。このプロジェクトは、この決定論的な27-D特徴フレームが、従来の学習済み埋め込みの代わりにクラス条件付きDDPMの条件付けメカニズムとして機能できるかどうかを検証している。
開発者のZimengXiongは、Hunyuan3D-PaintおよびHunyuan3D-ShapeモデルのSwift-MLXおよびPython MLXへのポートを完了し、Apple Siliconデバイスでのローカルな画像から3Dへの生成を可能にしました。この取り組みは、macOSおよびiOS向けのオープンソースModelrデスクトップアプリとして配布されており、Swiftアプリケーションへの技術統合のためのソースコードも含まれています。
Fabricio3gは、最近のsd.cppリリースを中心に構築されたローカルデスクトップユーザーインターフェースであるFlaxeo Imageをリリースしました。このアプリケーションは、生成、編集、動画パス、モデル管理、ハードウェアオプションなど、バックエンドの機能の大部分を公開することを目指しています。