Un estudio empírico de 86.156 parches de archivos de prueba procedentes de 33.596 PRs generados por agentes revela que el 80,2% de los parches de prueba contienen señales de oráculo débiles o inexistentes. Los archivos de prueba con oráculo fuerte mejoran significativamente la probabilidad de fusión (OR = 1,28, p < 0,001) después de ajustar por múltiples factores, lo que indica que la presencia del archivo de prueba por sí sola sobrestima la fuerza de verificación.
Señales de oráculo en código de prueba generado por agentes
ChronicleBio utiliza IA para curar POTS; Mind Lab prueba el aprendizaje continuo de Macaron-V1
ChronicleBio, fundada por la ex ejecutiva de OpenAI Fidji Simo, está utilizando IA y 153 terabytes de datos sanguíneos para curar el Síndrome de Taquicardia Ortostática Postural (POTS). Mientras tanto, el modelo Macaron-V1 de Mind Lab supera a GLM-5.2 en benchmarks al cambiar dinámicamente entre cinco módulos expertos LoRA para el aprendizaje continuo.
Acuerdo entre AMD y Anthropic: AMD suministrará chips MI450 e invertirá $5 mil millones
AMD y Anthropic han firmado un acuerdo importante que involucra decenas de miles de millones de dólares en servidores de IA, con Anthropic comprando hasta 2 gigavatios de chips Instinct MI450 de AMD a partir del primer semestre del próximo año. Simultáneamente, AMD invertirá hasta $5 mil millones en Anthropic a medida que se cumplan hitos específicos de implementación, mientras ambas empresas colaboran para identificar centros de datos adecuados para el hardware.
Thinking Machines lanza Inkling; Anthropic prepara una OPI; OpenAI entrena GPT-Red
Thinking Machines ha lanzado Inkling, un modelo de mezcla de expertos de 975B parámetros con 41B parámetros activos y razonamiento multimodal. Simultáneamente, Anthropic se está preparando para una posible OPI a finales de este año tras una ronda de financiación de 65 mil millones de dólares con una valoración de 965 mil millones de dólares. OpenAI también ha entrenado GPT-Red para generar iterativamente prompts adversarios, lo que redujo los fallos en un benchmark de inyección de prompts en seis veces para GPT-5.6 Sol.
Claude Code añade navegador integrado; Cursor construye un agente general
Anthropic ha añadido un navegador integrado en la aplicación a Claude Code para escritorio, permitiendo que la herramienta lea, navegue e interactúe con sitios web y documentación de manera similar a los servidores de desarrollo locales. Paralelamente, informes indican que Cursor está desarrollando un agente de IA de propósito general diseñado para manejar correos electrónicos, mensajes, hojas de cálculo y tareas de ingeniería.
GPT-5 supera a los humanos en la inducción de estados de creencia mediante planificación
Un nuevo estudio evalúa la capacidad de los Modelos de Lenguaje Grande (LLM) para inducir estados de creencia específicos en otros agentes mediante acciones en lugar de conversación, una capacidad denominada ToM de Planificación No Conversacional (NCP-ToM). Utilizando el marco NCP-ExploreToM, los investigadores probaron seis modelos de vanguardia y participantes humanos en 600 instancias de tareas donde los agentes debían mover objetos o dirigir personajes para lograr objetivos de creencia.