Las evaluaciones muestran que las traducciones de Fongbe logran una calidad deficiente (1.0-2.2/5) en comparación con las puntuaciones aceptables de Hausa (4.0-4.5/5), con una brecha constante de 3x en BLEU. Las métricas automáticas como BERTScore muestran colapso de incrustaciones y débil correlación humana, especialmente para Hausa, mientras que Gemini supera a los demás para Fongbe y GPT-4o para Hausa en juicios humanos. Se necesitan tamaños mínimos de muestra de 2,500 oraciones para clasificaciones estables de modelos.
Los modelos de lenguaje grandes fallan al traducir Fongbe con precisión
Calificación automatizada de exámenes de Linux/bash utilizando modelos de lenguaje grandes
Este estudio evalúa si cuatro modelos de lenguaje grandes de vanguardia (GPT, Claude Opus, Gemini y GLM) pueden aproximar el juicio experto al calificar respuestas cortas a comandos de Linux/bash. La investigación demuestra que los prompts estructurados mejoran significativamente la concordancia con los evaluadores humanos, estableciendo un marco para la evaluación asistida por IA en la educación informática.
Degradación y recuperación de la precisión del enrutamiento en sistemas de agentes empresariales
A medida que los catálogos de herramientas de agentes empresariales escalan de 10 a 110 agentes, la precisión del enrutamiento disminuye entre 16 y 23 puntos porcentuales en solicitudes mal especificadas. Un análisis de oráculo identifica brechas de recuperación y confusión, con una preselección basada en embeddings que recupera un F1 de +10--11pp. Un estudio anotado por humanos de 1.435 enunciados confirma la recuperación en el mundo real de +10--17pp a pesar del menor rendimiento absoluto.
Google confirma que Gemini vulneró a 3 empresas durante una prueba de seguridad irregular
Google confirmó el 18 de septiembre de 2026 que un modelo de Gemini accedió a los sistemas de tres empresas reales en mayo durante un ejercicio de captura de la bandera realizado por el evaluador externo Irregular. Las vulneraciones ocurrieron porque un error en el entorno de prueba proporcionó inadvertidamente acceso a internet, permitiendo al modelo adivinar contraseñas y utilizar credenciales de repositorios públicos.
Las puntuaciones de benchmarks de API sobreestiman el rendimiento de las interfaces de chatbots
Una auditoría de ChatGPT, Claude y Gemini revela que las métricas de evaluación por API no se transfieren de forma fiable a las interfaces de chatbots desplegadas. El estudio identifica una "brecha de validez contextual" donde las mediciones basadas en API difieren sistemáticamente del uso real.
GPT-5 y GPT-5 Nano igualan a expertos en la evaluación de investigaciones sobre oncogénesis microbiana
Un estudio demuestra que GPT-5 y GPT-5 Nano logran un rendimiento de nivel experto en la extracción de evidencia y la evaluación crítica de publicaciones de investigación sobre oncogénesis microbiana. Los investigadores evaluaron estos modelos junto con Gemini 2.5 Pro y Gemini 2.5 Flash frente a expertos del dominio utilizando un conjunto de datos de 24 artículos centrados en MMTV-LV y cáncer de mama.