Tema · Benchmark results
lab NVIDIA Research · hace 12 d · 20 vistas

ReasoningBomb induce razonamiento patológicamente largo en modelos de razonamiento grandes

Los investigadores han formalizado ataques de denegación de servicio en tiempo de inferencia (PI-DoS) que explotan el alto costo computacional del razonamiento explícito multi-paso en Modelos de Razonamiento Grandes (LRMs). Presentan ReasoningBomb, un marco basado en aprendizaje por refuerzo que entrena a un atacante para generar prompts naturales cortos que llevan a los modelos víctimas a trazos de razonamiento patológicamente largos y a menudo no terminantes.

media MarkTechPost · hace 2 d GDPval-AA (Elo) · 1695.0Elo · 13 vistas

SpaceXAI lanza Grok 4.7 con un modelo base más grande y mejores resultados en benchmarks

SpaceXAI ha lanzado Grok 4.7, un nuevo modelo insignia para codificación, tareas agénticas y trabajo de conocimiento que utiliza un modelo base más grande y una ejecución de aprendizaje por refuerzo extendida en comparación con Grok 4.6. El modelo mantiene la misma estructura de precios que su predecesor mientras ofrece capacidades mejoradas en autoverificación, manejo de contexto largo y seguridad.

media The Batch · hace 13 d GPQA Diamond · 96.3% · 29 vistas

OpenAI lanza GPT-6 Astra, encabeza los rankings con menor costo

OpenAI ha lanzado GPT-6 Astra, su nuevo modelo de lenguaje y visión insignia que alcanza las posiciones más altas o cercanas a la cima en los principales rankings de IA, mientras utiliza significativamente menos tokens y tiene un costo inferior al de los modelos competidores. El modelo está diseñado para cumplir con el nivel crítico de ciberseguridad de OpenAI, con capacidades avanzadas de ciberseguridad restringidas a organizaciones seleccionadas.

media AI News (smol.ai) · hace 22 d · 44 vistas

Anthropic lanza Claude Fable 5.1 y Mythos 5.1 con precios reducidos de caché

Anthropic ha lanzado Claude Fable 5.1 y Claude Mythos 5.1 como sus nuevos modelos insignia para codificación y trabajo de conocimiento, posicionándolos como capaces de realizar tareas autónomas y multietapa. El lanzamiento incluye una reducción significativa en el precio de lectura de caché a $0.25 por millón de tokens, junto con una ventana de contexto de 1 millón de tokens.

media Together AI Blog · hace 26 d · 51 vistas

La destilación de GLM-5.3 Flash intercambia consistencia por una reducción de costo de 17x

Una comparación de GLM-5.3 y su variante destilada, GLM-5.3 Flash, en el benchmark DeepSWE revela que la destilación preserva la capacidad central de codificación mientras reduce significativamente los costos de rollout. El modelo completo logra una tasa de pass@1 del 69.0% a $3.99 por tarea, mientras que la variante Flash obtiene un puntaje de 63.4% a solo $0.24, lo que representa una reducción de precio de 17x.

lab Hugging Face Blog · hace 1 d · 14 vistas

AISI publica resultados verificados de evaluación para seis modelos de vanguardia en cinco benchmarks

El Instituto de Seguridad de IA del Reino Unido (AISI) ha puesto a disposición pública los métodos de evaluación y los hallazgos reportados a través de la plataforma Evaluation Cards de EvalEval para mejorar la reproducibilidad de los benchmarks. Esta publicación incluye resultados verificados, contexto e información de configuración para cinco benchmarks específicos: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro y Terminal-Bench 2.0.

media Interconnects · hace 3 d Artificial Analysis Intelligence Index · 45.0% · 19 vistas

Los modelos chinos de peso abierto superan a sus contrapartes estadounidenses en descargas y benchmarks

El autor presenta un informe sobre el estado de los modelos de peso abierto, señalando que las empresas de IA chinas se han convertido en los claros líderes en este espacio desde aproximadamente abril de 2025. Este cambio queda evidenciado por las métricas de descarga de Hugging Face y el rendimiento en benchmarks de capacidades.

media Hugging Face Forums · hace 7 d · 15 vistas

El Índice de Desperdicio de Agentes califica 341.054 ejecuciones públicas de agentes de codificación por patrones de desperdicio

El Índice de Desperdicio de Agentes ha calificado 341.054 trayectorias de agentes procedentes de 11 conjuntos de datos públicos para identificar ineficiencias como bucles, reintentos ciegos, salidas de herramientas desmesuradas y ejecuciones abandonadas. El análisis revela que los comportamientos de bucle y reintento son prevalentes en modelos más débiles como los agentes Llama, pero raros en Claude 3.7 Sonnet y Qwen3-Coder-480B.