NanoMaestro Realtime es un modelo de música con IA de 50 MB con 13M parámetros que genera música de piano en tiempo real utilizando una LSTM de 2 capas. Se ejecuta localmente en el navegador a través de ONNX y Transformers.js con WASM, sin requerir GPU ni backend de servidor, y funciona en modelos antiguos de Raspberry Pi.
Modelo de música con IA se ejecuta en tiempo real en la mayoría de las CPU dentro del navegador
Gradio lanza Workflow1111, reconstruyendo las funciones de AUTOMATIC1111 como un grafo de Gradio
Gradio ha lanzado Workflow1111, un proyecto que reconstruye la mayoría del conjunto de funciones de stable-diffusion-webui de AUTOMATIC1111 utilizando el framework gr.Workflow. La aplicación consiste en un único lienzo que contiene once pipelines multimedia construidos a partir de setenta y tres nodos, cubriendo tareas de texto a imagen, imagen a video y varias tareas de preprocesamiento.
Boogu-Image-0.1: Serie de modelos unificados de generación y edición de imágenes de código abierto
Boogu-Image-0.1 es una familia de modelos unificados de generación y edición de imágenes de código abierto con licencia Apache-2.0, que incluye variantes Base, Turbo y Edit. Ofrece generación de texto a imagen de alta calidad, generación rápida, edición de imágenes y una sólida renderización de texto en chino e inglés, con un volumen de datos de entrenamiento aproximadamente una orden de magnitud menor que el de los sistemas propietarios, pero logrando un rendimiento competitivo gracias a la mejora en la comprensión del modelo y la calidad de los datos.
Llevar Moebius 0.2B Image Inpainting al navegador con Claude Code
El modelo de inpintado de imágenes Moebius 0.2B se ha portado con éxito para ejecutarse en el navegador usando WebGPU y ONNX Runtime. El proyecto, iniciado con Claude Code, convierte los pesos del modelo a ONNX y los despliega a través de Hugging Face, con una interfaz web simple disponible en.
Sumi: Modelo de lenguaje de difusión uniforme abierto desde cero
Sumi es un modelo de lenguaje de difusión uniforme de 7B parámetros preentrenado desde cero con 1.5T tokens. Compite con modelos autoregresivos en tareas de conocimiento, razonamiento y codificación, pero tiene un rendimiento inferior en benchmarks de sentido común, probablemente debido a su mezcla de datos centrada en la educación. Los pesos del modelo, los puntos de control y la receta completa de entrenamiento se han liberado públicamente.
OpenEnv reproduce el modelo de acuarela de Surya Narreddi usando TRL
Un ingeniero ha liberado como código abierto una reproducción del proyecto viral de Surya Narreddi, que entrena un modelo de programación para pintar acuarelas utilizando JavaScript y aprendizaje por refuerzo. La implementación utiliza la biblioteca TRL y OpenEnv para crear un pipeline de extremo a extremo en Hugging Face para entrenamiento, puntuación e inferencia.