NanoMaestro Realtime est un modèle de musique IA de 50 Mo avec 13 M de paramètres qui génère de la musique de piano en temps réel à l'aide d'un LSTM à 2 couches. Il s'exécute localement dans le navigateur via ONNX et Transformers.js avec WASM, ne nécessitant ni GPU ni backend serveur, et fonctionne sur les anciens modèles de Raspberry Pi.
Un modèle de musique IA fonctionne en temps réel sur la plupart des CPU dans le navigateur
Gradio publie Workflow1111, reconstruisant les fonctionnalités d'AUTOMATIC1111 sous forme de graphe Gradio
Gradio a publié Workflow1111, un projet qui reconstruit la plupart des fonctionnalités de stable-diffusion-webui d'AUTOMATIC1111 en utilisant le framework gr.Workflow. L'application se compose d'un seul canevas contenant onze pipelines multimédias construits à partir de soixante-treize nœuds, couvrant la génération d'images à partir de texte, la vidéo à partir d'images et diverses tâches de prétraitement.
OpenEnv reproduit le modèle de peinture aquarelle de Surya Narreddi avec TRL
Un ingénieur a open-sourcé une reproduction du projet viral de Surya Narreddi, qui entraîne un modèle de codage à peindre des aquarelles en utilisant JavaScript et l'apprentissage par renforcement. L'implémentation utilise la bibliothèque TRL et OpenEnv pour créer un pipeline de bout en bout sur Hugging Face pour l'entraînement, l'évaluation et l'inférence.
Diffusers ajoute le support natif de l'inférence Nunchaku Lite 4-bit
Hugging Face Diffusers prend désormais en charge le chargement natif des points de contrôle Nunchaku Lite via `from_pretrained()`, éliminant ainsi le besoin d'un moteur d'inférence séparé ou d'une compilation CUDA locale. Cette intégration utilise la méthode SVDQuant pour exécuter les couches transformateur avec des poids et activations en 4 bits (W4A4), réduisant considérablement l'utilisation de la mémoire tout en améliorant la vitesse d'inférence.
NVIDIA NeMo Automodel permet le fine-tuning distribué de modèles de diffusion avec Hugging Face Diffusers
NVIDIA et Hugging Face ont intégré NVIDIA NeMo Automodel à la bibliothèque 🤗 Diffusers pour fournir un entraînement distribué de qualité production pour les modèles de diffusion open-source. Cette collaboration permet aux utilisateurs de fine-tuner n'importe quel modèle au format Diffusers sur le Hub Hugging Face sans nécessiter de conversion de checkpoints ni de réécriture du code du modèle.
Simon Willison crée un animal de compagnie personnalisé pour Codex Desktop en utilisant GPT-5.6 et gpt-image-2
Simon Willison démontre comment créer un "animal de compagnie" animé personnalisé pour l'application Codex Desktop en exploitant le modèle GPT-5.6 Sol d'OpenAI et l'API gpt-image-2.