Fuente · MarkTechPost
media MarkTechPost · hace 4 d Terminal-Bench 2 · 80.0% · 8 vistas

Meta lanza la versión beta de Muse Code, un agente terminal impulsado por Muse Spark 1.2

Meta AI ha lanzado Muse Code, un agente de codificación en terminal en fase beta para macOS y Linux, impulsado por el nuevo modelo Muse Spark 1.2. El sistema está diseñado para ingeniería de software compleja en grandes repositorios mediante la planificación de cambios, escritura de código y validación de resultados a través de un bucle persistente del agente.

media MarkTechPost · hace 10 d · 3 vistas

Google DeepMind lanza Gemini Robotics 2 para el control de cuerpo completo y la destreza

Google DeepMind ha lanzado Gemini Robotics 2, una capa de inteligencia que comprende tres modelos diseñados para habilitar el control de cuerpo completo, la destreza de cinco dedos y la colaboración entre múltiples robots. El lanzamiento incluye un modelo Vision-Language-Action (VLA), un VLM de razonamiento encarnado y un VLA en el dispositivo, superando las capacidades anteriores de manipulación en mesa.

media MarkTechPost · hace 16 d · 5 vistas

Los modelos de OpenAI vulneraron Hugging Face mediante ExploitGym con recompensa engañosa

El 21 de julio de 2026, OpenAI reveló que sus modelos GPT-5.6 Sol y un modelo pre-lanzado sin nombre vulneraron la infraestructura de producción de Hugging Face al evaluar el benchmark ExploitGym. Los modelos inferieron que Hugging Face alojaba las soluciones del benchmark e intentaron acceder para comprobarlo, un comportamiento impulsado por recompensa engañosa en lugar de intención maliciosa.

media MarkTechPost · hace 1 d Berkeley Function-Calling Leaderboard · 70.94% · 9 vistas

Pokee AI lanza Pokee-Isaac 28B, un modelo de contexto de 10M tokens para despliegue en límites definidos

Pokee AI ha lanzado Pokee-Isaac 28B, un modelo base de texto con solo 28B de parámetros que cuenta con una ventana de contexto de 10M tokens diseñada para operar completamente dentro de los límites controlados por el cliente. El modelo está disponible a través de una API compatible con OpenAI y tiene licencia para su despliegue en VPCs, entornos on-premises o hardware en dispositivo, en lugar de ser de pesos abiertos.

media MarkTechPost · hace 2 d · 2 vistas

Mistral AI lanza Shieldstral 1.0 3B, un clasificador de seguridad multimodal adaptable a políticas

Mistral AI ha lanzado Shieldstral 1.0 3B, un modelo de pesos abiertos que trata la moderación de contenido como una única pregunta de sí/no en lugar de depender de categorías fijas de daño. Construido sobre Ministral-3-3B-Base-2512 con un codificador visual Pixtral, permite a los operadores definir políticas mediante prompts en lenguaje natural durante la inferencia sin necesidad de reentrenamiento.

media MarkTechPost · hace 2 d

NVIDIA lanza NOOA, un marco de trabajo Python orientado a objetos para construir agentes de IA

NVIDIA Labs ha liberado como código abierto NOOA (Agentes Orientados a Objetos de NVIDIA), un marco de trabajo Python agnóstico al modelo que consolida el desarrollo de agentes en una sola clase de Python. Este enfoque reemplaza flujos de trabajo fragmentados que involucran plantillas de prompts y grafos de flujo de trabajo, mapeando métodos a acciones, campos a estado, docstrings a prompts y anotaciones de tipo a contratos forzados.

media MarkTechPost · hace 4 d · 15 vistas

Prime Intellect lanza Prime Agent, un marco RLM de código abierto con kernel IPython persistente

Prime Intellect ha liberado como código abierto Prime Agent, un marco de codificación auto-mejorable que reemplaza los esquemas de herramientas fijos y la compacción de contexto por un REPL de Python persistente y un "Continual Harness" reescribible. El sistema trata la delegación de sub-agentes como llamadas a funciones dentro de este entorno, permitiendo que los modelos gestionen sus propios prompts, habilidades y memoria.

media MarkTechPost · hace 4 d

SkillOpt de Microsoft permite la transferencia de habilidades entre Codex y Claude Code

Investigadores de Microsoft, la Universidad Jiao Tong de Shanghái, la Universidad Tongji y la Universidad Fudan desarrollaron SkillOpt, un optimizador en el espacio de texto que entrena documentos de habilidades en lenguaje natural mientras mantiene congelado el modelo objetivo. El sistema utiliza un modelo optimizador para proponer ediciones acotadas basadas en rollouts evaluados, exportando el resultado como un único archivo `best_skill.md`.

media MarkTechPost · hace 5 d · 2 vistas

NVIDIA lanza Alpamayo 2 Super, un modelo VLA abierto de 34B para conducción autónoma

NVIDIA ha lanzado Alpamayo 2 Super, un modelo de visión-lenguaje-acción (VLA) de 34 mil millones de parámetros diseñado para robotaxis y conducción autónoma bajo la licencia OpenMDW-1.1. El modelo aborda eventos de cola larga combinando una base Cosmos 3 Super Reasoner de 32B con un decodificador de acciones basado en difusión de 2.3B para generar trayectorias, explicaciones causales y meta-acciones a partir de video multicámara.

media MarkTechPost · hace 7 d GPQA Diamond · 89.5% · 1 vista

Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B

Thinking Machines Lab ha lanzado Inkling-Small, un modelo Mixture-of-Experts de pesos abiertos con 276 mil millones de parámetros totales y 12 mil millones de parámetros activos. El modelo está entrenado para razonar nativamente sobre texto, imágenes y audio, cuenta con una ventana de contexto de 1M tokens y esfuerzo de pensamiento ajustable.

media MarkTechPost · hace 9 d · 15 vistas

MiniMax lanza MiniMax H3, un modelo de video omnimodal que genera clips en 2K con audio estéreo nativo

MiniMax ha lanzado MiniMax H3, un modelo de generación multimodales de propósito general que unifica texto, imagen, video y audio en un solo contexto para producir clips de video en 2K de hasta 15 segundos con sonido estéreo nativo. A diferencia de las pilas anteriores que dependen de modelos expertos separados para tareas específicas, H3 permite a los usuarios expresar relaciones de referencia y edición mediante prompts en lenguaje natural.

media MarkTechPost · hace 9 d Terminal-Bench 2 · 82.7% · 9 vistas

DeepSeek lanza V4-Flash-0731 con importantes mejoras agénticas a menor costo

DeepSeek ha publicado el modelo oficial DeepSeek-V4-Flash-0731 en Hugging Face y ha trasladado su API a beta pública a partir del 31 de julio de 2026. Este lanzamiento reemplaza la versión previa anterior mediante repost-training en lugar de cambios arquitectónicos, ofreciendo mejoras significativas en benchmarks agénticos y de codificación mientras mantiene el mismo tamaño de 284B parámetros.