Las evaluaciones muestran que las traducciones de Fongbe logran una calidad deficiente (1.0-2.2/5) en comparación con las puntuaciones aceptables de Hausa (4.0-4.5/5), con una brecha constante de 3x en BLEU. Las métricas automáticas como BERTScore muestran colapso de incrustaciones y débil correlación humana, especialmente para Hausa, mientras que Gemini supera a los demás para Fongbe y GPT-4o para Hausa en juicios humanos. Se necesitan tamaños mínimos de muestra de 2,500 oraciones para clasificaciones estables de modelos.
Los modelos de lenguaje grandes fallan al traducir Fongbe con precisión
Calificación automatizada de exámenes de Linux/bash utilizando modelos de lenguaje grandes
Este estudio evalúa si cuatro modelos de lenguaje grandes de vanguardia (GPT, Claude Opus, Gemini y GLM) pueden aproximar el juicio experto al calificar respuestas cortas a comandos de Linux/bash. La investigación demuestra que los prompts estructurados mejoran significativamente la concordancia con los evaluadores humanos, estableciendo un marco para la evaluación asistida por IA en la educación informática.
Degradación y recuperación de la precisión del enrutamiento en sistemas de agentes empresariales
A medida que los catálogos de herramientas de agentes empresariales escalan de 10 a 110 agentes, la precisión del enrutamiento disminuye entre 16 y 23 puntos porcentuales en solicitudes mal especificadas. Un análisis de oráculo identifica brechas de recuperación y confusión, con una preselección basada en embeddings que recupera un F1 de +10--11pp. Un estudio anotado por humanos de 1.435 enunciados confirma la recuperación en el mundo real de +10--17pp a pesar del menor rendimiento absoluto.
GPT-5 y GPT-5 Nano igualan a expertos en la evaluación de investigaciones sobre oncogénesis microbiana
Un estudio demuestra que GPT-5 y GPT-5 Nano logran un rendimiento de nivel experto en la extracción de evidencia y la evaluación crítica de publicaciones de investigación sobre oncogénesis microbiana. Los investigadores evaluaron estos modelos junto con Gemini 2.5 Pro y Gemini 2.5 Flash frente a expertos del dominio utilizando un conjunto de datos de 24 artículos centrados en MMTV-LV y cáncer de mama.
GPT-5 y GPT-5 Nano igualan a expertos en la extracción de evidencia sobre oncogénesis microbiana
Un estudio que evalúa modelos de lenguaje grandes en la síntesis sistemática de evidencia para la oncogénesis microbiana encontró que GPT-5 y GPT-5 Nano se desempeñan de manera indistinguible de los expertos del dominio. Los investigadores evaluaron Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 y GPT-5 Nano en 24 artículos de investigación utilizando una plantilla estructurada de 77 elementos a través de múltiples tipos de preguntas.
GPT-5 supera a los humanos en la inducción de estados de creencia mediante planificación
Un nuevo estudio evalúa la capacidad de los Modelos de Lenguaje Grande (LLM) para inducir estados de creencia específicos en otros agentes mediante acciones en lugar de conversación, una capacidad denominada ToM de Planificación No Conversacional (NCP-ToM). Utilizando el marco NCP-ExploreToM, los investigadores probaron seis modelos de vanguardia y participantes humanos en 600 instancias de tareas donde los agentes debían mover objetos o dirigir personajes para lograr objetivos de creencia.