NanoMaestro Realtimeは、13Mパラメータを持つ50MBのAI音楽モデルで、2層LSTMを使用してピアノ音楽をリアルタイムに生成します。ONNXとTransformers.jsおよびWASMを介してブラウザ内でローカルに実行され、GPUやサーバーバックエンドを必要とせず、古いRaspberry Piモデルでも動作します。
AI音楽モデルがブラウザ内でほとんどのCPUでリアルタイムに動作
GradioがWorkflow1111をリリース、AUTOMATIC1111の機能をGradioグラフとして再構築
Gradioは、gr.Workflowフレームワークを使用してAUTOMATIC1111のstable-diffusion-webuiの機能セットの大部分を再構築したプロジェクトであるWorkflow1111をリリースしました。このアプリケーションは、73ノードから構築された11のメディアパイプラインを含む単一のキャンバスで構成されており、テキストから画像への変換、画像から動画への変換、および各種前処理タスクをカバーしています。
OpenEnvがTRLを使ってSurya Narreddiの水彩画モデルを再現
エンジニアが、JavaScriptと強化学習を用いてコーディングモデルに水彩画を描かせるというSurya Narreddi氏の viral プロジェクトの再現版をオープンソースとして公開しました。この実装では、TRLライブラリとOpenEnvを活用し、Hugging Face上でトレーニング、スコアリング、推論を行うエンドツーエンドのパイプラインが構築されています。
DiffusersがNunchaku Liteの4ビット推論をネイティブサポート
Hugging Face Diffusersは、`from_pretrained()`経由でNunchaku Liteチェックポイントをネイティブに読み込む機能を追加し、個別の推論エンジンやローカルCUDAコンパイルの必要性を排除しました。この統合ではSVDQuant方式を用いて4ビット重みと活性化(W4A4)によるTransformerレイヤーを実行し、メモリ使用量を大幅に削減しつつ推論速度を向上させます。
NVIDIA NeMo AutomodelがHugging Face Diffusersと連携し、分散型拡散モデルのファインチューニングを実現
NVIDIAとHugging Faceは、NVIDIA NeMo Automodelを🤗 Diffusersライブラリと統合し、オープンソースの拡散モデルに対して本番環境対応の分散トレーニングを提供しました。この協力により、ユーザーはチェックポイントの変換やモデルコードの書き換えを行うことなく、Hugging Face Hub上のDiffusers形式のモデルをファインチューニングできます。
Simon Willison氏がGPT-5.6とgpt-image-2を使用してCodex Desktopのペットを作成
Simon Willison氏は、OpenAIのGPT-5.6 Solモデルとgpt-image-2 APIを活用して、Codex Desktopアプリケーションのカスタムアニメーション「ペット」を作成する方法を実演します。