BabelJudge introduce un marco de código abierto para medir cuatro modos clave de sesgo en jueces LLM a través de idiomas y trayectorias de agentes. Revela una caída significativa en la confiabilidad del hindi al suajili: de 0.714 a 0.550, destacando una degradación intercultural invisible para la precisión bruta. El marco permite evaluaciones conscientes del sesgo sin etiquetas humanas, utilizando perturbaciones controladas para crear etiquetas doradas conocidas, y se extiende a flujos de trabajo agénticos con nuevas métricas sobre precisión de herramientas y detección de alucinaciones.
BabelJudge: Midiendo la confiabilidad de LLM-as-a-Judge en múltiples idiomas y trayectorias de agentes
Estabilización de la intención de herramientas en RAG en streaming
Un estudio mide la estabilización de la intención de herramientas en RAG en streaming, definiendo cuándo las consultas de herramientas especulativas convergen a respuestas correctas. En el benchmark CRAG, el 73.9% de las consultas permiten ocultar latencia sustancial, con estabilización temprana observada en preguntas con evidencia recuperable literalmente. El tipo de pregunta predice significativamente la estabilización temprana frente a la tardía, informando cuándo los disparadores especulativos son efectivos.
El ranking Open TTS lanza una evaluación escalable de TTS multilingüe
Se ha publicado el ranking Open TTS para abordar la fragmentación y la falta de estandarización en la evaluación del texto a voz (TTS), utilizando métricas objetivas en lugar de depender únicamente de puntuaciones lentas de preferencia humana basadas en arenas. Evalúa modelos en inteligibilidad, velocidad y similitud del hablante mediante incrustaciones de Qwen3 ASR y WavLM.
El envenenamiento de documentos obsoletos hace que la recuperación desactualizada anule las respuestas correctas del modelo
Los investigadores identifican el "envenenamiento de documentos obsoletos", una falla de alineación temporal en la Generación Aumentada por Recuperación (RAG) donde la evidencia externa desactualizada provoca que los modelos proporcionen respuestas incorrectas a pesar de conocer la respuesta adecuada sin recuperación.
Claude Opus 5 y Tetsu encuentran seis comprobaciones de CI huecas en su propio proyecto
El 27 de septiembre, Claude Opus 5 y el modelo Tetsu de 3B identificaron seis comprobaciones de integración continua separadas en su repositorio público que informaban estado verde o superaban la prueba a pesar de no verificar lo que se suponía que debían medir. Los problemas iban desde un filtro de despliegue que rechazaba reinicios válidos debido a resúmenes obsoletos hasta benchmarks de temporización con umbrales huecos que aceptaban diferencias de rendimiento insignificantes.
pop123-ux lanza 38 cuadernos ejecutables para aprender Hugging Face eliminando abstracciones
El usuario pop123-ux ha publicado un repositorio de aprendizaje que contiene 38 cuadernos ejecutables diseñados para ayudar a los usuarios a comprender la pila de Hugging Face eliminando progresivamente las abstracciones de alto nivel. La colección cubre un camino desde componentes centrales como transformers y tokenizers hasta el ajuste fino, PEFT, razonamiento/RL y trabajo en proyectos de extremo a extremo.