Un estudio de 3,750 consultas en cinco industrias encuentra una concentración moderada de recomendaciones, con un coeficiente Gini medio de 0.28. El acuerdo entre modelos sobre las marcas más recomendadas fue solo del 41.6%, y los puntajes de desplazamiento variaron por industria, oscilando entre 0.4:1 y 4.3:1. Los resultados desafían la narrativa de 'el ganador se lo lleva todo' e introducen tres métricas reproducibles para el análisis de inteligencia competitiva.
Propiedad de las recomendaciones de IA: Mapa empírico de la propiedad de categorías de marca
La reputación de marca construida por IA está vinculada al idioma
Las reputaciones de marca generadas por IA varían significativamente según el idioma, con las lenguas urálicas y bálticas mostrando un sentimiento más positivo y las lenguas germánicas, incluido el inglés, siendo más críticas. El idioma de la consulta impacta en qué marcas se recomiendan, especialmente para los campeones locales, donde las consultas en el idioma nativo aumentan la visibilidad en 0.80 puntos en comparación con las consultas en inglés. La monitorización exclusivamente en inglés no logra captar la total visibilidad de IA de las marcas con sede local, creando un punto ciego lingüístico medible.
GPT-5 y GPT-5 Nano igualan a expertos en la evaluación de investigaciones sobre oncogénesis microbiana
Un estudio demuestra que GPT-5 y GPT-5 Nano logran un rendimiento de nivel experto en la extracción de evidencia y la evaluación crítica de publicaciones de investigación sobre oncogénesis microbiana. Los investigadores evaluaron estos modelos junto con Gemini 2.5 Pro y Gemini 2.5 Flash frente a expertos del dominio utilizando un conjunto de datos de 24 artículos centrados en MMTV-LV y cáncer de mama.
GPT-5 y GPT-5 Nano igualan a expertos en la extracción de evidencia sobre oncogénesis microbiana
Un estudio que evalúa modelos de lenguaje grandes en la síntesis sistemática de evidencia para la oncogénesis microbiana encontró que GPT-5 y GPT-5 Nano se desempeñan de manera indistinguible de los expertos del dominio. Los investigadores evaluaron Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 y GPT-5 Nano en 24 artículos de investigación utilizando una plantilla estructurada de 77 elementos a través de múltiples tipos de preguntas.
Calificación automatizada de exámenes de Linux/bash utilizando modelos de lenguaje grandes
Este estudio evalúa si cuatro modelos de lenguaje grandes de vanguardia (GPT, Claude Opus, Gemini y GLM) pueden aproximar el juicio experto al calificar respuestas cortas a comandos de Linux/bash. La investigación demuestra que los prompts estructurados mejoran significativamente la concordancia con los evaluadores humanos, estableciendo un marco para la evaluación asistida por IA en la educación informática.
OpenBioRQ: Benchmark para la Fidelidad de la Investigación Biomédica Agéntica
OpenBioRQ introduce un benchmark de 12,553 preguntas de investigación biomédica sin resolver en 12 dominios, diseñado para probar la fidelidad y la abstención de los modelos agénticos. Evalúa los modelos en un entorno de uso de herramientas sin claves de respuesta, utilizando evidencia real de seguimiento en lugar de conocimiento paramétrico, y revela un colapso agéntico significativo en las preguntas más difíciles donde las herramientas ya no se utilizan a pesar de ser críticas.