Dos configuraciones de API triplicaron las puntuaciones de GPT-5.6 en ARC-AGI-3
Habilitar dos configuraciones específicas de API para GPT-5.6 resultó en un triple de sus puntuaciones de rendimiento en la benchmark ARC-AGI-3.
Habilitar dos configuraciones específicas de API para GPT-5.6 resultó en un triple de sus puntuaciones de rendimiento en la benchmark ARC-AGI-3.
Una comparación de DeepSeek-V4 Flash 0731 y GPT-5.6 Luna en el benchmark DeepSWE revela que, aunque GPT-5.6 Luna es el ingeniero más fuerte, una estrategia en cascada que utiliza ambos modelos logra mayor precisión a menor costo.
Alibaba ha anunciado Qwen3.8-Max como su nuevo modelo insignia, describiéndolo como una arquitectura dispersa de 2.4T parámetros centrada en trabajo agénico de largo alcance, codificación y razonamiento multimodal. La compañía confirmó que los pesos abiertos para Qwen3.8-Max se lanzarán la próxima semana junto con la variante de pesos abiertos Qwen3.8-27B.
DeepSeek ha actualizado su modelo V4 Flash, lanzando una nueva versión el 2026-07-31 que muestra ganancias significativas de rendimiento sobre la vista previa anterior. La actualización introduce resultados para varios nuevos benchmarks mientras mejora las puntuaciones en los existentes.
Una comparación entre Kimi K3 y GPT-5.6 Sol en el benchmark DeepSWE revela que, aunque GPT-5.6 Sol lidera en calidad de intento único (72.7% frente a 68.5%), Kimi K3 logra puntuaciones pass@k más altas para k > 1 con un costo significativamente menor.
Anthropic ha lanzado el modelo Claude Opus 5, lo que ha provocado un escrutinio de su rendimiento en métricas de codificación y capacidades generales, junto con un renovado debate sobre la evaluación de modelos de vanguardia.
Anthropic ha lanzado Claude Opus 5, un nuevo modelo de vanguardia que ha generado un debate significativo sobre las puntuaciones en benchmarks y el rendimiento práctico. Evaluaciones independientes de Epoch AI reportan un Índice de Capacidades Epoch (ECI) de 159 y un SWE-ECI de 161 para el nuevo modelo.
Kimi K3, un modelo de pesos abiertos de Moonshot AI, logra un rendimiento comparable al de Claude Fable 5 de Anthropic en el benchmark DeepSWE mientras cuesta significativamente menos por tarea. En una evaluación del 16 de julio de 2026, Kimi K3 alcanzó un 68,5% de pass@1 frente al 69,9% de Fable 5, pero lo superó en escenarios de múltiples intentos y ofreció una mayor eficiencia de costos.
Sierra Research lanzó τ-bench 1.0.1, que corrige el esquema de evaluación de la tarea `banking_knowledge` para dejar de penalizar a los agentes por lecturas de verificación prudentes y soluciona varias inconsistencias en los datos. La actualización asegura que la reevaluación de las trayectorias del ranking solo aumente las puntuaciones, sin que simulaciones que anteriormente aprobadas fallen.
El 16 de julio, Moonshot AI lanzó su último modelo insignia, Kimi K3, una arquitectura Mixture of Experts (MoE) con 2,8 billones de parámetros. La compañía ha prometido liberar los pesos del modelo el 27 de julio.
Moonshot ha lanzado Kimi K3, un modelo de peso abierto que ha desencadenado una reevaluación de cuán cerca están los modelos chinos de la vanguardia. El lanzamiento se caracteriza por un rendimiento sólido en codificación, tareas agénticas y trabajo de conocimiento a largo plazo.
Moonshot AI ha presentado Kimi K3, un nuevo modelo de pesos abiertos de clase fronteriza que cuenta con 2.8 billones de parámetros totales y capacidades nativas de entrada multimodal. Posicionado oficialmente como "Inteligencia Fronteriza Abierta", el modelo admite una ventana de contexto de 1 millón de tokens y utiliza componentes arquitectónicos novedosos como Kimi Delta Attention (KDA) y Residuos de Atención para mejorar la eficiencia.
Moonshot AI ha lanzado Kimi K3, un modelo de pesos abiertos de clase fronteriza con 2.8 billones de parámetros y entrada multimodal nativa. El modelo cuenta con Kimi Delta Attention (KDA) para una decodificación más rápida en contextos largos y está orientado a flujos de trabajo de codificación agéntica de largo alcance.
El laboratorio de IA chino Moonshot AI ha anunciado Kimi K3, describiéndolo como su modelo más capaz hasta la fecha con 2.8 billones de parámetros. El modelo está actualmente disponible a través del sitio web y la API, con una liberación de pesos abiertos prometida para el 27 de julio de 2026.
DharmaOCR logra mayor calidad y estabilidad en la extracción que Mistral OCR4 y Unlimited-OCR en portugués de Brasil gracias al entrenamiento específico del dominio.
El artículo presenta los resultados del benchmark ARC-AGI para el modelo DeepSeek V4 Flash 0731. Enlaza a la página oficial de resultados alojada por la organización ARC Prize.
DeepSeek ha lanzado DeepSeek-V4-Flash-0731, una versión actualizada de su modelo "Flash" más pequeño que supera al mayor DeepSeek-V4-Pro en benchmarks independientes. El lanzamiento utiliza un nuevo proceso de ajuste fino mientras mantiene la arquitectura original de Mezcla de Expertos con 284 mil millones de parámetros en total.
Artificial Analysis ha actualizado su índice agéntico para clasificar a Qwen 3.8 Max como el mejor modelo general, colocándolo por encima de Opus 5.
Los autores identifican que las puntuaciones estancadas en el benchmark SciCode provienen de defectos significativos en el instrumento de evaluación, más que de limitaciones en la capacidad del modelo. Una auditoría de expertos en el dominio de 65 problemas de prueba descubrió 263 defectos, con 192 que causaban que soluciones correctas fueran rechazadas erróneamente debido a problemas como respuestas doradas no reproducibles y tolerancias excesivamente ajustadas.
Qwen 3.8 Max alcanza una puntuación de 1588 en el Debate Benchmark, superando la puntuación de 1462 de Qwen 3.7 Max. Este benchmark evalúa qué tan bien los grandes modelos de lenguaje sostienen un argumento bajo oposición adversarial y multironda en diversos temas.