Fuente · Hugging Face Blog
lab Hugging Face Blog · hace 30 d GPQA Diamond · 67.4% · 41 vistas

La QAH de Multiverse Computing hace que GPT-OSS de 4 bits supere a su versión original de precisión completa

Multiverse Computing presenta la Curación Consciente de Cuantización (QAH), un método que destila grandes modelos de lenguaje comprimidos y cuantizados directamente a partir de sus maestros originales previos a la compresión. Aplicado a un modelo GPT-OSS 120B comprimido a 60B parámetros y cuantizado a MXFP4, el enfoque produce un modelo que supera su propia versión bfloat16 de precisión completa en 7 de los 9 benchmarks.

lab Hugging Face Blog · hace 10 h · 8 vistas

NVIDIA Warp y MjWarp habilitan la simulación paralela de robótica acelerada por GPU

MuJoCo Warp (MJWarp), basado en NVIDIA Warp, permite que los modelos compatibles de MuJoCo se ejecuten a escala de GPU, posibilitando el avance de cientos o miles de mundos de simulación independientes en una sola llamada. Esta arquitectura desplaza el enfoque desde la minimización de la latencia para un solo entorno hacia la mejora del rendimiento agregado, lo cual favorece el aprendizaje por refuerzo y el muestreo a gran escala.

lab Hugging Face Blog · hace 15 h · 11 vistas

NVIDIA lanza el modelo de diarización Nemotron 3 de pesos abiertos

NVIDIA ha lanzado Nemotron 3 Diarization, un modelo de pesos abiertos con 100M de parámetros para diarización de hablantes en tiempo real que admite hasta ocho hablantes. El modelo ocupa el puesto #1 en la lista de clasificación Diarization-Bench de VoiceArena con una Tasa de Error de Diarización (DER) del 14.72%, superando al siguiente sistema clasificado con una reducción relativa aproximada del 24%.

lab Hugging Face Blog · hace 1 d · 14 vistas

AISI publica resultados verificados de evaluación para seis modelos de vanguardia en cinco benchmarks

El Instituto de Seguridad de IA del Reino Unido (AISI) ha puesto a disposición pública los métodos de evaluación y los hallazgos reportados a través de la plataforma Evaluation Cards de EvalEval para mejorar la reproducibilidad de los benchmarks. Esta publicación incluye resultados verificados, contexto e información de configuración para cinco benchmarks específicos: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro y Terminal-Bench 2.0.

lab Hugging Face Blog · hace 3 d · 10 vistas

tokenizers v1 release candidate ofrece codificación 3-30x más rápida mediante división de bitstream y caché

La biblioteca tokenizers ha lanzado una versión candidata a release 1 que mejora significativamente el rendimiento para la codificación de texto, abordando cuellos de botella en los flujos de trabajo de entrenamiento y servicio. La actualización mantiene compatibilidad con la API de v0.23 mientras proporciona aceleraciones sustanciales en diez familias de modelos.

lab Hugging Face Blog · hace 3 d MMLU · 77.0% · 15 vistas

Multiverse reformula la eliminación de bloques LLM como optimización de Ising para compresión profunda

Multiverse ha publicado un artículo que detalla un método que reformula la poda de modelos de lenguaje grandes como un problema de optimización binaria restringida mapeado a un vidrio de Ising. Al tratar los bloques del transformador como espines con acoplamientos por pares derivados de la Hessiana de la pérdida, el enfoque identifica configuraciones óptimas de eliminación de bloques sin requerir evaluación iterativa.

lab Hugging Face Blog · hace 9 d · 18 vistas

ALTK-Evolve introduce directrices de consistencia para reducir a la mitad las brechas de fiabilidad de los agentes

Los investigadores han introducido "directrices de consistencia" dentro del sistema ALTK-Evolve, un nuevo mecanismo diseñado para abordar la variabilidad en el rendimiento de los agentes LLM que a menudo ocultan las métricas estándar de precisión promedio. Al identificar y estabilizar los puntos de decisión propensos a cambios, este enfoque mejora significativamente la consistencia del éxito de la tarea sin sacrificar la capacidad general.

lab Hugging Face Blog · hace 10 d · 16 vistas

TRL v1.14 AsyncGRPOTrainer permite sincronización solo con LoRA en Hugging Face Jobs

TRL v1.14 introduce soporte para LoRA en AsyncGRPOTrainer, permitiendo entrenar un adaptador de Low-Rank Adaptation y sincronizar únicamente ese pequeño archivo con los trabajadores de inferencia de vLLM. Esta arquitectura desacopla los trabajos de entrenamiento y generación en máquinas separadas mediante el uso de un Storage Bucket compartido como puente de sistema de archivos, eliminando la necesidad de NCCL o comunicación directa de red entre nodos.

lab Hugging Face Blog · hace 14 d · 26 vistas

Gradio lanza Workflow1111, reconstruyendo las funciones de AUTOMATIC1111 como un grafo de Gradio

Gradio ha lanzado Workflow1111, un proyecto que reconstruye la mayoría del conjunto de funciones de stable-diffusion-webui de AUTOMATIC1111 utilizando el framework gr.Workflow. La aplicación consiste en un único lienzo que contiene once pipelines multimedia construidos a partir de setenta y tres nodos, cubriendo tareas de texto a imagen, imagen a video y varias tareas de preprocesamiento.

lab Hugging Face Blog · hace 16 d · 26 vistas

Multiverse Computing propone la auto-distilación consciente de límites para un rechazo preciso de seguridad en LLM

Un artículo de Multiverse Computing presenta un método para entrenar modelos de lenguaje a rechazar solo subconjuntos específicos dañinos de un tema, en lugar de toda la categoría, abordando las limitaciones de las barreras de guardia ciegas a nivel de tema. El enfoque utiliza auto-distilación consciente de límites con reparación de cobertura y datos benignos dentro de la distribución para mantener la seguridad mientras se reducen los falsos rechazos en solicitudes legítimas.

lab Hugging Face Blog · hace 21 d · 35 vistas

NeoMME lanza codificadores multimodales eficientes con recuperación de interacción densa y tardía

Los investigadores presentan NeoMME, una familia de codificadores multimodales multilingües de 260M y 800M que procesan texto y parches de imagen crudos utilizando un único Transformer bidireccional. A diferencia de los modelos de lenguaje visual generativos, NeoMME no depende de torres visuales preentrenadas por separado ni de decodificadores causales; entrena todo el modelo desde cero con un objetivo de difusión discreta enmascarada.

lab Hugging Face Blog · hace 22 d · 30 vistas

BenchMIRT audita benchmarks de LLM separando señales de seguridad y razonamiento

Los investigadores presentan BenchMIRT, un método para auditar benchmarks de modelos de lenguaje grandes a nivel de prompt individual utilizando Teoría de Respuesta al Ítem multidimensional. Al analizar el rendimiento en 100 modelos y 34.000 preguntas, la herramienta desentraña capacidades mezcladas como seguridad y razonamiento general que a menudo oscurecen las puntuaciones del benchmark.