Benchmark results
lab Hugging Face Blog · hace 15 h · 9 vistas

AISI publica resultados verificados de evaluación para seis modelos de vanguardia en cinco benchmarks

El Instituto de Seguridad de IA del Reino Unido (AISI) ha puesto a disposición pública los métodos de evaluación y los hallazgos reportados a través de la plataforma Evaluation Cards de EvalEval para mejorar la reproducibilidad de los benchmarks. Esta publicación incluye resultados verificados, contexto e información de configuración para cinco benchmarks específicos: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro y Terminal-Bench 2.0.

media MarkTechPost · hace 21 h GDPval-AA (Elo) · 1695.0Elo · 13 vistas

SpaceXAI lanza Grok 4.7 con un modelo base más grande y mejores resultados en benchmarks

SpaceXAI ha lanzado Grok 4.7, un nuevo modelo insignia para codificación, tareas agénticas y trabajo de conocimiento que utiliza un modelo base más grande y una ejecución de aprendizaje por refuerzo extendida en comparación con Grok 4.6. El modelo mantiene la misma estructura de precios que su predecesor mientras ofrece capacidades mejoradas en autoverificación, manejo de contexto largo y seguridad.

media Interconnects · hace 2 d Artificial Analysis Intelligence Index · 45.0% · 17 vistas

Los modelos chinos de peso abierto superan a sus contrapartes estadounidenses en descargas y benchmarks

El autor presenta un informe sobre el estado de los modelos de peso abierto, señalando que las empresas de IA chinas se han convertido en los claros líderes en este espacio desde aproximadamente abril de 2025. Este cambio queda evidenciado por las métricas de descarga de Hugging Face y el rendimiento en benchmarks de capacidades.

media Hugging Face Forums · hace 6 d · 13 vistas

El Índice de Desperdicio de Agentes califica 341.054 ejecuciones públicas de agentes de codificación por patrones de desperdicio

El Índice de Desperdicio de Agentes ha calificado 341.054 trayectorias de agentes procedentes de 11 conjuntos de datos públicos para identificar ineficiencias como bucles, reintentos ciegos, salidas de herramientas desmesuradas y ejecuciones abandonadas. El análisis revela que los comportamientos de bucle y reintento son prevalentes en modelos más débiles como los agentes Llama, pero raros en Claude 3.7 Sonnet y Qwen3-Coder-480B.

media MarkTechPost · hace 7 d LMSYS Arena (Elo) · 1866.0Elo · 20 vistas

Prior Labs lanza TabPFN-3.5, superando al ganador de Otto Kaggle 2015 con configuración predeterminada

Prior Labs ha lanzado TabPFN-3.5, un modelo base tabular que predice sobre una tabla en un solo pase hacia adelante sin entrenamiento ni ajuste por conjunto de datos. El modelo obtiene 0.375 en el ranking privado del Desafío de Clasificación de Productos Otto Group 2015, superando la puntuación ganadora original de 0.382 lograda por Gilberto Titericz y Stanislav Semenov.

media MarkTechPost · hace 7 d · 28 vistas

Nums AI lanza Causilo, un modelo base tabular que lidera TabArena entre modelos individuales

Nums AI ha lanzado Causilo, un modelo base tabular preentrenado para clasificación y regresión que alcanza la puntuación Elo más alta entre modelos individuales en TabArena. El modelo utiliza un enfoque de aprendizaje in-context donde las filas de entrenamiento se almacenan como contexto en lugar de actualizar los pesos, y está disponible con código bajo licencia Apache-2.0 y pesos preentrenados en Hugging Face.

arxiv arXiv cs.CL · hace 8 d Codeforces (Elo) · 98.2% · 27 vistas

Stellar Colosseum aprovecha la inferencia multiagente para investigación matemática a largo plazo

Stellar Colosseum es un harness agnóstico al modelo diseñado para distribuir la inferencia en investigaciones de largo alcance en matemáticas y ciencias teóricas de la computación, abordando la falta de fiabilidad de los modelos de lenguaje en problemas complejos. El sistema explora estrategias alternativas antes de la construcción de pruebas, utiliza un gate de preparación para determinar cuándo una ruta está lo suficientemente madura para la descomposición, y representa el plan de prueba como subproblemas interdependientes a nivel de sección.

arxiv arXiv cs.LG · hace 8 d Codeforces (Elo) · 98.2% · 25 vistas

Coliseo Estelar: un arnés para múltiples agentes enfocado en investigación matemática y de ciencias de la computación teórica a largo plazo

Los autores presentan Stellar Colosseum, un arnés agnóstico al modelo diseñado para distribuir la inferencia en investigaciones a largo plazo en matemáticas y ciencias de la computación teórica. El sistema explora estrategias alternativas antes de la construcción de pruebas, utiliza un filtro de preparación para determinar cuándo una ruta está lo suficientemente madura para su descomposición y representa el plan de prueba como subproblemas interdependientes a nivel de sección.

arxiv arXiv cs.AI · hace 9 d · 25 vistas

La reevaluación por expertos revela que los modelos de vanguardia están cerca de la saturación en pruebas de física

Un estudio que audita seis pruebas de física ampliamente utilizadas encuentra que las puntuaciones bajas reportadas para los modelos de lenguaje de vanguardia se deben en gran medida a errores en la evaluación y no a deficiencias del modelo. Los expertos revisaron los enunciados de los problemas, las soluciones de referencia y las respuestas de los modelos, distinguiendo errores genuinos de equivocaciones del evaluador, referencias incorrectas y preguntas ambiguas.

media MarkTechPost · hace 10 d Terminal-Bench 2 · 92.8% · 28 vistas

Cognition lanza SWE-2, un modelo de codificación post-entrenado con Kimi K3 y esfuerzo de razonamiento seleccionable

Cognition ha lanzado SWE-2, su modelo de codificación más capaz hasta la fecha, que se ha post-entrenado con aprendizaje por refuerzo a partir del modelo abierto de 2.8T parámetros de Moonshot AI, Kimi K3. El modelo obtiene un 50.0% en FrontierCode 1.1 Main, situándose a un punto de Fable 5.1 mientras opera con un coste un 64% menor.

lab NVIDIA Research · hace 11 d · 16 vistas

ReasoningBomb induce razonamiento patológicamente largo en modelos de razonamiento grandes

Los investigadores han formalizado ataques de denegación de servicio en tiempo de inferencia (PI-DoS) que explotan el alto costo computacional del razonamiento explícito multi-paso en Modelos de Razonamiento Grandes (LRMs). Presentan ReasoningBomb, un marco basado en aprendizaje por refuerzo que entrena a un atacante para generar prompts naturales cortos que llevan a los modelos víctimas a trazos de razonamiento patológicamente largos y a menudo no terminantes.