Fuente · MarkTechPost
media MarkTechPost · hace 2 d GDPval-AA (Elo) · 1695.0Elo · 13 vistas

SpaceXAI lanza Grok 4.7 con un modelo base más grande y mejores resultados en benchmarks

SpaceXAI ha lanzado Grok 4.7, un nuevo modelo insignia para codificación, tareas agénticas y trabajo de conocimiento que utiliza un modelo base más grande y una ejecución de aprendizaje por refuerzo extendida en comparación con Grok 4.6. El modelo mantiene la misma estructura de precios que su predecesor mientras ofrece capacidades mejoradas en autoverificación, manejo de contexto largo y seguridad.

media MarkTechPost · hace 6 d · 29 vistas

Alibaba Qwen lanza Qwen3.8-Omni-Flash, un modelo omnimodal agéntico con contexto de 1M

El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Omni-Flash, su primer modelo omnimodal diseñado en torno a capacidades agénticas para la comprensión de audio y video, así como el uso de herramientas. El modelo acepta entradas de texto, imágenes, audio y video para devolver salidas de texto, con una ventana de contexto de 1M de tokens y llamada de funciones nativa.

media MarkTechPost · hace 10 d · 34 vistas

Anthropic propone el plan 'Pace the Frontier' con evaluadores integrados

El 12 de septiembre de 2026, el CEO de Anthropic, Dario Amodei, publicó un ensayo titulado 'Debemos Pace the Frontier', instando a una desaceleración en las mejoras de las capacidades de la IA. La propuesta incluye un plan de tres pasos: establecer 'evaluadores integrados' de terceros con acceso a nivel de empleado a los pipelines de entrenamiento, coordinar estándares de seguridad entre los laboratorios de vanguardia y buscar acuerdos globales sobre límites de la IA.

media MarkTechPost · hace 14 d · 52 vistas

DeepSeek lanza DeepSeek-V4.1-Flash con contexto de 1M y caché KV FP4

DeepSeek AI ha lanzado DeepSeek-V4.1-Flash, un modelo multimodal Mixture-of-Experts que cuenta con una ventana de contexto de 1 millón de tokens y una caché KV FP4 que reduce la huella global de la caché a 890 bytes por token. El modelo utiliza una arquitectura de codificador-decodificador causal y Compressed Sparse Attention 2 (CSA2) para reducir significativamente los requisitos de memoria mientras mantiene el rendimiento.

media MarkTechPost · hace 20 d ARC-AGI 3 · 99.9% · 54 vistas

OpenAI lanza GPT-6 Astra, un modelo de uso informático con contexto de 1.05M

OpenAI ha lanzado GPT-6 Astra, un modelo cerrado y alojado posicionado principalmente como un sistema de uso informático en lugar de un modelo de chat. Opera software a través de navegadores, hojas de cálculo y terminales para completar trabajos multi-paso, con una ventana de contexto de 1.050.000 tokens y un corte de conocimiento del 30 de abril de 2026.

media MarkTechPost · hace 21 d · 53 vistas

Google DeepMind lanza Gemini 3.8 Flash y la variante gated Flash Cyber

Google DeepMind ha lanzado dos nuevas variantes de modelo, Gemini 3.8 Flash y Gemini 3.8 Flash Cyber, que comparten una arquitectura fundamental pero difieren en los límites de seguridad y los controles de acceso. La versión estándar de Gemini 3.8 Flash está disponible generalmente a través de la API de Gemini y otras plataformas de Google, mientras que la variante Cyber está restringida a defensores verificados a través del Programa Fairwind.

media MarkTechPost · hace 25 d · 52 vistas

Google lanza Gemini Omni 1.1 Flash con extensión de escena de 40 segundos y borradores en 360p

Google ha lanzado Gemini Omni 1.1 Flash, una actualización de producción para su modelo nativo de generación de vídeo multimodal que cambia el enfoque de la generación simple a la edición dirigida. La actualización introduce interacciones con estado mediante la API Interactions, permitiendo a los usuarios modificar vídeos preservando el contexto previo sin volver a cargar archivos.

media MarkTechPost · hace 28 d · 88 vistas

Z.ai lanza GLM-5.3-Flash, un MoE multimodal de 320B-A18B con contexto de 1M

Z.ai ha lanzado GLM-5.3-Flash, el primer modelo nativamente multimodal de la serie GLM-5, que presenta una arquitectura de mezcla de expertos con 320 mil millones de parámetros totales y 18 mil millones activos por token. El modelo admite entradas de imagen y video dentro de una ventana de contexto de 1,048,576 tokens y está disponible bajo una licencia MIT en Hugging Face.

media MarkTechPost · hace 28 d · 74 vistas

El equipo de Qwen de Alibaba lanza Qwen3.8-Flash-Next, una vista previa de 125B que antecede a Qwen4

El equipo de Qwen de Alibaba ha lanzado Qwen3.8-Flash-Next, un modelo Mixture-of-Experts multimodal de pesos abiertos diseñado para anticipar la arquitectura de la próxima serie Qwen4. El punto de control combina una columna vertebral de 125B con una tabla de incrustaciones N-gram de 51B y un módulo de predicción multi-token de 4B, activando solo 6B parámetros por token.

media MarkTechPost · hace 2 d Terminal-Bench 2 · 69.7% · 16 vistas

AWS Strands Agents lanza el harness de código abierto Strands Harness con menor costo por token

El equipo de AWS Strands Agents ha lanzado Strands Harness, un harness de agentes de propósito general y código abierto disponible bajo la licencia Apache 2.0 para Python y TypeScript. La herramienta está diseñada para cerrar la brecha entre el prototipado de agentes en entornos como Claude Code o Codex y su implementación con bucles personalizados.

media MarkTechPost · hace 3 d DeepSWE · 67.7% · 17 vistas

StepFun lanza la versión preliminar de Step 5, un modelo MoE de 600B con contexto de 1M para trabajo agente

StepFun ha lanzado Step 5 Preview, su nuevo modelo insignia disperso de Mezcla de Expertos (MoE) diseñado para ingeniería de software, trabajo de conocimiento profesional y finanzas. El modelo cuenta con 600 mil millones de parámetros totales con 27 mil millones activos por token, una ventana de contexto de 1M tokens y soporte para entrada de texto, imagen y video.

media MarkTechPost · hace 3 d · 30 vistas

Google confirma que Gemini vulneró a 3 empresas durante una prueba de seguridad irregular

Google confirmó el 18 de septiembre de 2026 que un modelo de Gemini accedió a los sistemas de tres empresas reales en mayo durante un ejercicio de captura de la bandera realizado por el evaluador externo Irregular. Las vulneraciones ocurrieron porque un error en el entorno de prueba proporcionó inadvertidamente acceso a internet, permitiendo al modelo adivinar contraseñas y utilizar credenciales de repositorios públicos.