Sevra, un controlador de la capa de servicio, verifica selectivamente las respuestas para mejorar la precisión y reducir el uso de tokens. En \mathfive, alcanza una precisión del 76.3% con un 26.8% menos de tokens posteriores a la generación y reduce a la mitad los cambios dañinos, mientras que en \gsm verifica solo el 3.0% de los ejemplos, aumentando la precisión al 94.5% y reduciendo los tokens de verificación en un 91.2%. El estudio muestra que la longitud inicial de la resolución y las necesidades de control explícito determinan la estrategia óptima de verificación.
Verificación selectiva para el razonamiento consciente del presupuesto
GSM-Plus-BN presenta un benchmark basado en perturbaciones para el razonamiento matemático en bengalí
El estudio introduce GSM-Plus-BN, un nuevo conjunto de datos matemáticos en bengalí perturbado derivado del benchmark GSM-Plus en inglés y verificado por traductores humanos. Este recurso aborda la falta de benchmarks sistemáticos para evaluar la robustez de los modelos en regiones lingüísticamente diversas como Bangladés.
SpectralQuant Qwen3.5 0.8B Q4_K_M recupera el 96,5 % de la brecha de BF16
Spectral Labs ha publicado una candidata a lanzamiento para una cuantización Q4_K_M consciente de la calibración del modelo Qwen3.5 0.8B, utilizando un nuevo método llamado SpectralQuant. Este enfoque busca que las huellas estándar de Q4_K_M se comporten más como formatos de cuantización mayores mientras mantiene la compatibilidad con llama.cpp.
LLMs evaluados para la detección de vulnerabilidades web
Un estudio evalúa seis LLMs en la detección de vulnerabilidades web del mundo real en plugins de WordPress, encontrando que las tasas de detección varían según el modelo y el diseño del prompt. Claude Opus 4.6 logró la tasa de detección más alta con un 63%, mientras que Qwen 3.5 solo alcanzó un 35%, y ningún modelo identificó consistentemente todas las vulnerabilidades de referencia a través de las iteraciones.
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia con 240 elementos de prueba en árabe en ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación con el árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.
Análisis KLD de la cuantización del KV Cache para Qwen3.6-35B-A3B y Gemma4-E2B QAT
Un análisis detallado mapea la KLD (divergencia de Kullback-Leibler) de la cuantización del KV cache para los modelos Qwen3.6-35B-A3B y Gemma4-E2B. Los resultados muestran que la cuantización q8/q8 es casi sin pérdidas en ambos modelos, mientras que q4/q4 funciona bien en Qwen pero causa una degradación severa en Gemma. Las variantes de cuantización Turbo muestran un rendimiento mixto, con turbo3 y turbo2 permitiendo una compresión extrema del cache a costa significativa de la precisión.