Gemma 4 E2B alcanza 255 tokens por segundo en el navegador en un M4 Max utilizando kernels de WebGPU. La demostración y los kernels ya están disponibles en Hugging Face para uso público.
Gemma 4 E2B se ejecuta a 255 tok/s en el navegador usando WebGPU
Google actualiza las plantillas de chat de Gemma 4 con correcciones de llamada a herramientas y soporte para Flash Attention 4
Google ha lanzado una actualización del modelo Gemma 4 que modifica sus plantillas de chat. Los cambios abordan problemas significativos con las capacidades de llamada a herramientas y reducen la "pereza" en las respuestas del modelo.
Specific Labs dirige a Gemma-4-31B para rechazar premisas falsas sin impacto en benchmarks
Specific Labs ha lanzado Gemma-4-31B-AntiHal, una variante del modelo Gemma-4-31B que desafía las solicitudes basadas en premisas falsas en lugar de alucinar junto con ellas. El modelo logra esto mediante el direccionamiento de representación basado en interpretabilidad aplicado al flujo residual durante la generación.
Zer0Fit envuelve TabFM y TimesFM de Google como un servidor MCP local
Un desarrollador ha creado Zer0Fit, una implementación de código abierto que sirve los modelos base de Google TabFM y TimesFM como un servidor Model Context Protocol (MCP) para tareas de aprendizaje automático sin disparo (zero-shot). El proyecto permite a los usuarios realizar pronósticos, clasificaciones y regresiones localmente sin construir o entrenar modelos personalizados.
Gemma4-26B-A4B & 31B-QAT sin censura equilibrado lanzado con aceleraciones de velocidad MTP
HauhauCS ha lanzado dos nuevas versiones equilibradas y sin censura de los modelos Gemma 4: Gemma4-26B-A4B y Gemma4-31B-QAT. Ambas variantes incorporan cabezales de borrador de predicción multi-tokeno (MTP) para habilitar la decodificación especulativa, lo que resulta en mejoras significativas de velocidad de inferencia. El modelo 26B-A4B logra un aumento de velocidad de aproximadamente el 35%, mientras que el modelo 31B experimenta un incremento del 53%, con una calidad de salida idéntica verificada por el mecanismo de borrado del modelo. Estos lanzamientos utilizan cuantización consciente de QAT, haciendo que Q4_K_M sea el formato óptimo ya que una mayor precisión no ofrece ganancias de calidad para estos modelos específicos. El 26B-A4B es una arquitectura de Mezcla de Expertos con aproximadamente 4 mil millones de parámetros activos por token, mientras que la variante 31B es un modelo denso que ofrece mayor capacidad para usuarios con suficiente VRAM. Ambos modelos incluyen soporte de visión a través de archivos mmproj y mantienen una ventana de contexto de 262K. El autor señala que las pruebas de GenRM resultaron en cero rechazos en 465 prompts, confirmando su naturaleza sin censura.
llama.cpp Release b9741 Añade Nuevos Binarios y Soporte
llama.cpp versión b9741 introduce nuevos binarios para macOS, Linux, Android, Windows y openEuler en múltiples arquitecturas. El lanzamiento incluye soporte para Vulkan, CUDA 12.4 y 13.3, OpenVINO, SYCL y ROCm, con versiones actualizadas para iOS y Ubuntu.