Tema · Benchmark results
media AI News (smol.ai) · hace 5 d Terminal-Bench 2 · 67.4% · 8 vistas

Alibaba anuncia Qwen3.8-Max con 2.4T parámetros y pesos abiertos próximamente

Alibaba ha anunciado Qwen3.8-Max como su nuevo modelo insignia, describiéndolo como una arquitectura dispersa de 2.4T parámetros centrada en trabajo agénico de largo alcance, codificación y razonamiento multimodal. La compañía confirmó que los pesos abiertos para Qwen3.8-Max se lanzarán la próxima semana junto con la variante de pesos abiertos Qwen3.8-27B.

media Together AI Blog · hace 16 d · 5 vistas

Kimi K3 iguala a Claude Fable 5 en calidad de DeepSWE con un tercio del costo

Kimi K3, un modelo de pesos abiertos de Moonshot AI, logra un rendimiento comparable al de Claude Fable 5 de Anthropic en el benchmark DeepSWE mientras cuesta significativamente menos por tarea. En una evaluación del 16 de julio de 2026, Kimi K3 alcanzó un 68,5% de pass@1 frente al 69,9% de Fable 5, pero lo superó en escenarios de múltiples intentos y ofreció una mayor eficiencia de costos.

arxiv τ²-bench (tau2-bench) · hace 18 d · 1 vista

τ-bench 1.0.1 corrige la evaluación de banking_knowledge para evitar penalizar el comportamiento cauteloso del agente

Sierra Research lanzó τ-bench 1.0.1, que corrige el esquema de evaluación de la tarea `banking_knowledge` para dejar de penalizar a los agentes por lecturas de verificación prudentes y soluciona varias inconsistencias en los datos. La actualización asegura que la reevaluación de las trayectorias del ranking solo aumente las puntuaciones, sin que simulaciones que anteriormente aprobadas fallen.

media Latent Space · hace 24 d · 1 vista

Moonshot AI lanza Kimi K3, un modelo de frontera abierta con 2.8T parámetros

Moonshot AI ha presentado Kimi K3, un nuevo modelo de pesos abiertos de clase fronteriza que cuenta con 2.8 billones de parámetros totales y capacidades nativas de entrada multimodal. Posicionado oficialmente como "Inteligencia Fronteriza Abierta", el modelo admite una ventana de contexto de 1 millón de tokens y utiliza componentes arquitectónicos novedosos como Kimi Delta Attention (KDA) y Residuos de Atención para mejorar la eficiencia.

arxiv arXiv cs.AI · hace 4 d

SciCode-Verified corrige defectos del benchmark para revelar la verdadera capacidad de codificación científica de los modelos

Los autores identifican que las puntuaciones estancadas en el benchmark SciCode provienen de defectos significativos en el instrumento de evaluación, más que de limitaciones en la capacidad del modelo. Una auditoría de expertos en el dominio de 65 problemas de prueba descubrió 263 defectos, con 192 que causaban que soluciones correctas fueran rechazadas erróneamente debido a problemas como respuestas doradas no reproducibles y tolerancias excesivamente ajustadas.