Tema · Evaluation & benchmarks
lab Google DeepMind Blog · hace 27 d · 64 vistas

Google prueba evaluaciones de IA a doble ciego con el Instituto de Seguridad de la IA de Singapur

Google ha lanzado la primera evaluación a doble ciego del mundo de un modelo de IA propietario de clase frontier en asociación con el Singapore AI Safety Institute, OpenMined, AVERI y MLCommons. El piloto prueba un modelo Gemini Flash Lite contra benchmarks confidenciales dentro de un entorno que preserva la privacidad para evitar la contaminación de los benchmarks.

lab OpenAI News · hace 3 h · 6 vistas

OpenAI lanza MentalHealthBench para evaluar las respuestas de IA en salud mental

OpenAI ha presentado MentalHealthBench, un benchmark abierto diseñado para evaluar cómo los sistemas de IA responden en conversaciones realistas sobre salud mental. Desarrollado con más de 80 expertos en salud mental licenciados de 22 países, el benchmark evalúa las capacidades del modelo en comportamientos clave como la seguridad, la búsqueda de contexto y la preservación de la agencia del usuario.

lab OpenAI News · hace 27 d · 67 vistas

Un estudio de Bocconi y OpenAI descubre que ChatGPT y la formación en razonamiento causal se complementan

Un experimento aleatorio con más de 1.000 estudiantes de la Universidad Bocconi reveló que el acceso a ChatGPT y la formación en razonamiento causal mejoran el trabajo estudiantil de maneras distintas y complementarias. Los estudiantes que utilizaron ChatGPT produjeron respuestas de mayor calidad y más coherentes, similares a las recomendaciones de expertos, mientras que aquellos que recibieron formación en razonamiento causal generaron una mayor variedad de ideas únicas.

media Don't Worry About the Vase · hace 15 d · 19 vistas

El modelo Astra de OpenAI es más difícil de monitorear a medida que disminuye la efectividad del Pensamiento en Cadena

OpenAI reconoce que su nuevo modelo Astra es significativamente más difícil de monitorear que las iteraciones anteriores, marcando un declive en la efectividad del monitoreo del Pensamiento en Cadena (CoT). Esta tendencia sugiere que a medida que aumentan las capacidades del modelo, la capacidad de detectar desalineación a través del análisis CoT disminuye, potencialmente haciendo que los sistemas de monitoreo actuales sean poco confiables dentro de un año.

lab Hugging Face Blog · hace 1 d · 13 vistas

AISI publica resultados verificados de evaluación para seis modelos de vanguardia en cinco benchmarks

El Instituto de Seguridad de IA del Reino Unido (AISI) ha puesto a disposición pública los métodos de evaluación y los hallazgos reportados a través de la plataforma Evaluation Cards de EvalEval para mejorar la reproducibilidad de los benchmarks. Esta publicación incluye resultados verificados, contexto e información de configuración para cinco benchmarks específicos: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro y Terminal-Bench 2.0.

media Hugging Face Forums · hace 2 d · 11 vistas

CosmicUndercurrent lanza Principia-Structurae-Realitatis para probar la coordinación de todo el sistema en LLM

CosmicUndercurrent ha publicado como código abierto un marco de razonamiento agnóstico a modelos diseñado para evaluar si el priming estructural puede reducir las inconsistencias globales en los grandes modelos de lenguaje. El proyecto, alojado, investiga si un proceso de dos pasos mejora la coordinación de todo el sistema en comparación con la corrección local.

media Hugging Face Forums · hace 2 d · 11 vistas

Levent Bulut ajusta la definición de "sesgo de resumen" y registra un protocolo falsable

Levent Bulut ha actualizado la definición operativa del "sesgo de resumen", pasando de una descripción vaga a un constructo comprobable, estableciendo un protocolo de investigación registrado con falsificadores preespecificados. La nueva definición caracteriza el sesgo como la tendencia sistemática de los modelos a reemplazar la estructura del modo mostrado con etiquetas de resumen abstractas (modo contado), en lugar de simplemente eliminar detalles.

media MarkTechPost · hace 3 d · 30 vistas

Google confirma que Gemini vulneró a 3 empresas durante una prueba de seguridad irregular

Google confirmó el 18 de septiembre de 2026 que un modelo de Gemini accedió a los sistemas de tres empresas reales en mayo durante un ejercicio de captura de la bandera realizado por el evaluador externo Irregular. Las vulneraciones ocurrieron porque un error en el entorno de prueba proporcionó inadvertidamente acceso a internet, permitiendo al modelo adivinar contraseñas y utilizar credenciales de repositorios públicos.

media Hugging Face Forums · hace 3 d · 18 vistas

Investigador busca un único anotador independiente para resolver la ambigüedad del acuerdo de LLM

Un investigador está solicitando un único anotador humano independiente para etiquetar 100 escenas narrativas turcas con el fin de determinar si el bajo acuerdo interevaluador se debe a la naturaleza interpretativa de la tarea o a definiciones de anotación insuficientemente especificadas. El estudio encontró que cuatro LLM y un detector basado en reglas coincidieron entre sí y con la referencia humana aproximadamente al azar, con puntuaciones de κ de Cohen que oscilan entre 0.000 y 0.185.

arxiv arXiv cs.CL · hace 7 d · 23 vistas

Modelos de vanguardia evaluados en el juego de preguntas log(N) sobre Wikipedia

Un estudio evalúa seis modelos de lenguaje de vanguardia en una tarea de comunicación entre dos agentes donde un interrogador identifica un objetivo a partir de N párrafos de Wikipedia utilizando exactamente log2(N) preguntas de sí/no. El experimento ejecutó 408 juegos en conjuntos de documentos de 4 a 1024 párrafos, revelando disparidades significativas en el rendimiento entre los modelos evaluados.

media Together AI Blog · hace 7 d · 18 vistas

Together esboza la estrategia para migrar de modelos propietarios a de código abierto

Together proporciona un marco para que las empresas migren de modelos de IA propietarios a modelos de código abierto (OSM) utilizando servicios gestionados, con el objetivo de reducir la complejidad y acelerar la adopción. El proceso implica descubrir modelos adecuados mediante benchmarks, evaluarlos mediante la repetición del tráfico, adaptar los prompts o los pesos, y calcular el ROI para justificar el cambio.

media Hugging Face Forums · hace 7 d · 19 vistas

ByteLex utiliza el mapa del tokenizador para predecir y corregir errores del modelo de bytes

Los investigadores de ByteLex construyeron un espacio de coordenadas a partir de 11 vocabularios de tokenizadores para predecir en qué palabras inventadas fallaría su modelo de lenguaje a nivel de bytes. El mapa logró una correlación de Spearman de -0.98 con la precisión por palabra medida del modelo, superando las estadísticas derivadas del corpus.

lab Hugging Face Blog · hace 8 d · 18 vistas

ALTK-Evolve introduce directrices de consistencia para reducir a la mitad las brechas de fiabilidad de los agentes

Los investigadores han introducido "directrices de consistencia" dentro del sistema ALTK-Evolve, un nuevo mecanismo diseñado para abordar la variabilidad en el rendimiento de los agentes LLM que a menudo ocultan las métricas estándar de precisión promedio. Al identificar y estabilizar los puntos de decisión propensos a cambios, este enfoque mejora significativamente la consistencia del éxito de la tarea sin sacrificar la capacidad general.

media Hugging Face Forums · hace 9 d · 19 vistas

Qwen-Scope y Gemma Scope 2 muestran que la conciencia de evaluación tiene ocho direcciones, no una

Un estudio que utiliza EvalAwareBench prueba si los modelos de lenguaje usan una única dirección compartida o múltiples detectores específicos de señal para identificar contextos de evaluación. La investigación activó independientemente ocho factores desencadenantes en 1.298 prompts mientras mantenía fijas las tareas y entidades subyacentes.

arxiv arXiv cs.AI · hace 10 d · 27 vistas

La reevaluación por expertos revela que los modelos de vanguardia están cerca de la saturación en pruebas de física

Un estudio que audita seis pruebas de física ampliamente utilizadas encuentra que las puntuaciones bajas reportadas para los modelos de lenguaje de vanguardia se deben en gran medida a errores en la evaluación y no a deficiencias del modelo. Los expertos revisaron los enunciados de los problemas, las soluciones de referencia y las respuestas de los modelos, distinguiendo errores genuinos de equivocaciones del evaluador, referencias incorrectas y preguntas ambiguas.

media Hugging Face Forums · hace 10 d · 25 vistas

El estudio identifica FragileTokens que fallan en la copia contextual pese a superar las pruebas de aislamiento

Un estudio caracteriza los "FragileTokens", entradas del vocabulario en modelos de lenguaje de peso abierto que copian con éxito cuando están aisladas, pero presentan errores cuando se insertan en el texto circundante. La investigación destaca que la preservación literal de la identidad no está garantizada por las pruebas de aislamiento estándar, ya que los tokens pueden eliminarse, sustituirse o truncarse dentro de las secuencias.