Fuente · Hugging Face Forums
media Hugging Face Forums · hace 4 d · 1 vista

QuantCheck advierte contra asumir que el checkpoint final es el mejor para cuantización de 4 bits

Una nueva herramienta llamada QuantCheck destaca que el checkpoint final del preentrenamiento puede no ser la opción óptima para la cuantización de 4 bits, ya que los benchmarks pueden permanecer planos mientras aumenta la fragilidad. El autor observó este patrón en Pythia-160m, donde el checkpoint final sufrió aproximadamente cuatro veces más daño a la calidad que un checkpoint anterior de igual calidad.

media Hugging Face Forums · hace 5 d · 3 vistas

La Competencia GLEE en IAB@NeurIPS 2026 invita a presentaciones de agentes de IA para negociaciones

La Competencia GLEE, el evento oficial del Taller IAB en NeurIPS 2026, está aceptando participantes para construir agentes de IA capaces de negociación multironda, persuasión y diálogo. La competencia evalúa a los agentes por su capacidad de generar lenguaje, razonar estratégicamente y adaptarse a otros jugadores dentro de entornos económicos.

media Hugging Face Forums · hace 6 d · 3 vistas

LLM genera Hyperlambda con verificación en tiempo de ejecución para eliminar alucinaciones de funciones

Se ha configurado un LLM para generar código en el lenguaje Hyperlambda, donde cada invocación de función se verifica contra un conjunto conocido de funciones existentes durante la ejecución. Si el modelo intenta llamar a una función inexistente, el sistema reintenta automáticamente la generación hasta dos veces adicionales antes de devolver un error.

media Hugging Face Forums · hace 7 d · 3 vistas

IntelShed combina RAG híbrido, resolución de entidades GNN, aprendizaje federado y orquestación multiagente con LLM

El autor presenta IntelShed, un sistema de código abierto para inteligencia de código abierto (OSINT) que agrega 50 fuentes de datos públicas para producir informes de seguridad automatizados de 24 horas. La arquitectura integra recuperación híbrida, resolución de entidades basada en GNN, aprendizaje federado con privacidad diferencial y orquestación multiagente compilada por LLM.

media Hugging Face Forums · hace 7 d · 2 vistas

Qxern-v6 utiliza tokens latentes y un sidecar AST para una transferencia de código más rápida y precisa

El sistema Qxern-v6 permite que dos LLM se comuniquen mediante 32 tokens latentes comprimidos mientras preserva la exactitud de los símbolos a través de un sidecar de Abstract Syntax Tree (AST) determinista adaptativo. Desarrollado por un desarrollador de 15 años, la arquitectura utiliza Qwen2.5-Coder-1.5B para comprimir el código y un decodificador congelado Qwen3.5-0.8B para interpretarlo sin ver texto en bruto.

media Hugging Face Forums · hace 7 d

OpenGauntlet publica un catálogo de 168 sistemas TTS y 106 sistemas STT

Un investigador ha publicado el catálogo de investigación OpenGauntlet, un recurso público que contiene información sobre 168 sistemas de texto a voz (TTS) y 106 sistemas de voz a texto (STT). Los directorios cubren modelos de código abierto y alojados, licencias, requisitos de hardware, idiomas, capacidades, estado del ciclo de vida, información de origen y datos de benchmark publicados cuando están disponibles.

media Hugging Face Forums · hace 7 d · 1 vista

GPT-5.6 recupera el 95% de los mensajes ocultos en un benchmark de criptografía literaria inédito

Un documento de trabajo de Joseph JM Walker evalúa modelos de lenguaje de vanguardia en un benchmark de criptografía literaria multi-canal inédito incrustado en la novela física "I Wrote a Book and Made a Million Dollars (I.B. Wryten)." El estudio encuentra que GPT-5.6 reconoció independientemente el canal de comunicación secundario y recuperó aproximadamente el 95% del material incrustado en su primer pase, mientras que los modelos anteriores demostraron una capacidad efectivamente del 0%.

media Hugging Face Forums · hace 8 d · 8 vistas

Levent Bulut evalúa la fiabilidad de las anotaciones de LLM en proyecciones objetivas

Levent Bulut publicó un benchmark de tres estudios que evalúa la fiabilidad de las anotaciones generadas por máquinas para un corpus narrativo turco, revelando discrepancias significativas entre los evaluadores automatizados y el juicio humano. El estudio probó seis características artesanales binarias en 120 y 100 escenas utilizando detectores basados en reglas y modelos como Gemini 2.5 Flash, Grok, ChatGPT 5.5 y Claude Fable 5 High.