| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.6% |
DeepSeek lanza el modelo V4.1-Flash con soporte multimodal nativo
|
| 2026-09-07 |
K2-Horizon-MoVA-36B-A4B |
58.6% |
IFM lanza K2 Horizon: seis modelos Apache 2.0 de 0.9B a 375B
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
66.9% |
IFM lanza K2 Horizon: seis modelos Apache 2.0 de 0.9B a 375B
|
| 2026-09-04 |
Muse Spark 1.3 |
88.8% |
Meta lanza Muse Spark 1.3 con menos llamadas a herramientas y tokens
|
| 2026-08-26 |
Granite 4.2 30B |
29.24% |
IBM lanza Granite 4.2 con razonamiento nativo y RL agéntico para modelos empresariales abiertos
|
| 2026-08-26 |
Granite 4.2 8B |
20.56% |
IBM lanza Granite 4.2 con razonamiento nativo y RL agéntico para modelos empresariales abiertos
|
| 2026-08-21 |
Grok 4.6 |
88.4% |
SpaceXAI presenta Grok 4.6 con datos de Cursor para trabajo agéntico
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
83.9% |
DeepSeek lanza el modelo multimodal DeepSeek-V4-Flash-Vision-Exp
|
| 2026-08-20 |
agents |
94.0% |
Meta lanza Muse Video con audio nativo; Stripe adquiere OpenRouter
|
| 2026-08-19 |
Ornith-1.5 |
86.1% |
Ornith-1.5 lanza modelos de 9B, 35B-A3B y 397B con entrenamiento de auto-mejora
|
| 2026-08-13 |
DeepSeek-V4-Pro |
87.9% |
El lanzamiento GA de DeepSeek-V4-Pro mejora las capacidades del agente y añade soporte para la API de Respuestas
|
| 2026-08-13 |
Grok 4.6 |
88.4% |
xAI lanza Grok 4.6; Alibaba abre Qwen3.8-MoE; DeepSeek V4 Pro GA
|
| 2026-08-11 |
Opus 5 |
86.74% |
El agente auto-desarrollador Ouroboros establece nuevos récords con Opus 5
|
| 2026-08-10 |
Qwen3.6-27B |
60.7% |
Meta lanza Muse Glimmer, un modelo agente de pesos abiertos de 30B que funciona en una GPU para consumidores
|
| 2026-08-09 |
DeepSeek V4 Flash 0731 |
82.7% |
DeepSeek V4 Flash 0731 alcanza el 82.7% en Terminal-Bench 2.1 con un arnés público
|
| 2026-08-08 |
Pokee-Isaac 28B |
65.1% |
Pokee AI lanza Pokee-Isaac 28B, un modelo de contexto de 10M tokens para despliegue en límites definidos
|
| 2026-08-07 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek lanza V4-Flash-0731, superando a V4-Pro a menor costo
|
| 2026-08-05 |
Muse Spark 1.1 |
80.0% |
Meta lanza la versión beta de Muse Code, un agente terminal impulsado por Muse Spark 1.2
|
| 2026-08-05 |
Qwen3.8-Max |
67.4% |
Alibaba anuncia Qwen3.8-Max con 2.4T parámetros y pesos abiertos próximamente
|
| 2026-08-03 |
Qwen3.8-Max |
86.6% |
Alibaba lanza Qwen3.8-Max, un modelo MoE de 2.4T parámetros
|
| 2026-08-03 |
Inkling-Small |
64.7% |
Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B
|
| 2026-08-01 |
V4 Flash 0731 |
79.0% |
DeepSeek lanza V4-Flash con importantes mejoras post-entrenamiento y pesos abiertos
|
| 2026-08-01 |
DeepSeek-V4-Flash |
79.0% |
DeepSeek lanza V4-Flash con mejoras post-entrenamiento y pesos abiertos
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek lanza V4-Flash-0731 con importantes mejoras agénticas a menor costo
|
| 2026-07-31 |
DeepSeek-V4-Flash |
82.7% |
DeepSeek lanza la versión beta pública de DeepSeek-V4-Flash con capacidades mejoradas de agente
|
| 2026-07-27 |
Gemini 3.5 Flash-Lite |
54.0% |
Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber
|
| 2026-07-26 |
KAT-Coder-V2.5 |
60.7% |
KwaiKAT lanza KAT-Coder-V2.5, un modelo de codificación agente entrenado en más de 100.000 entornos verificables
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber para cargas de trabajo agénticas
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber
|
| 2026-07-08 |
hermes |
55.0% |
Los usuarios comparan Mimo v2.5 con DeepSeek V4 Flash y Hermes
|
| 2026-07-08 |
Grok 4.5 |
83.3% |
xAI lanza Grok 4.5 con bajo costo y rendimiento mixto en benchmarks
|
| 2026-07-07 |
LLM-as-a-Verifier |
86.5% |
LLM-as-a-Verifier presenta un marco de verificación de propósito general con puntuación continua
|
| 2026-07-05 |
GLM 5.2 FP8 with FP8 KV |
79.8% |
GLM 5.2 FP8 con KV FP8 alcanza 79,8% en Terminal-Bench 2.1
|
| 2026-06-27 |
Tmax-27B |
43.0% |
Tmax-27B Agente Terminal para GPUs Pequeñas con Entrenamiento DPPO
|
| 2026-06-27 |
Tmax |
27.0% |
Tmax: Una receta RL sencilla para agentes terminales
|
| 2026-04-25 |
Qwen3.6-27B |
59.3% |
Alibaba lanza Qwen3.6-27B, superando al predecesor más grande en benchmarks de programación
|
| 2026-04-25 |
GPT-5.5 |
82.7% |
OpenAI lanza GPT-5.5, un modelo reentrenado desde cero con procesamiento omnimodal nativo
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI lanza GPT-5.5 con capacidades agénticas y duplica los precios de la API
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI lanza GPT-5.5 y GPT-5.5 Pro en la API
|
| 2026-04-12 |
MiniMax M2.7 |
57.0% |
MiniMax abre el código fuente de M2.7, un modelo MoE autoevolutivo que obtiene 56.22% en SWE-Pro
|
| 2026-02-10 |
Step 3.5 Flash |
51.0% |
Paso 3.5 Flash: modelo MoE abierto con 11B activos alcanza rendimiento de agente de nivel fronterizo
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
58.1% |
OpenAI establece GPT-5.1-Codex-Max como predeterminado en Codex CLI
|