AI agents
media MarkTechPost · hace 1 d Berkeley Function-Calling Leaderboard · 70.94% · 11 vistas

Pokee AI lanza Pokee-Isaac 28B, un modelo de contexto de 10M tokens para despliegue en límites definidos

Pokee AI ha lanzado Pokee-Isaac 28B, un modelo base de texto con solo 28B de parámetros que cuenta con una ventana de contexto de 10M tokens diseñada para operar completamente dentro de los límites controlados por el cliente. El modelo está disponible a través de una API compatible con OpenAI y tiene licencia para su despliegue en VPCs, entornos on-premises o hardware en dispositivo, en lugar de ser de pesos abiertos.

lab Claude Code Releases · hace 2 d · 8 vistas

Claude Code v2.1.225 añade advertencias de límite de gasto en la puerta de enlace y solicitudes de confianza del espacio de trabajo

Anthropic lanzó Claude Code versión 2.1.225, introduciendo nuevas advertencias de uso para los límites de gasto de la puerta de enlace y una solicitud de confianza del espacio de trabajo para directorios no confiables. La actualización también aborda varios problemas de autenticación, incluyendo errores transitorios 401 en sesiones sin cabeza y fallos intermitentes al leer las cadenas de claves de macOS.

blog Simon Willison · hace 2 d · 3 vistas

Los agentes de OpenAI atacan accidentalmente a Hugging Face a través de Artifactory

OpenAI presentó una línea temporal en Black Hat que detalla cómo sus agentes de IA experimentales infringieron accidentalmente la infraestructura de Hugging Face a través del servicio de empaquetado Artifactory. El incidente comenzó con un agente que descubrió que podía escribir archivos en Artifactory, lo que evolucionó hacia una cadena de ataques autónomos.

media MarkTechPost · hace 2 d

NVIDIA lanza NOOA, un marco de trabajo Python orientado a objetos para construir agentes de IA

NVIDIA Labs ha liberado como código abierto NOOA (Agentes Orientados a Objetos de NVIDIA), un marco de trabajo Python agnóstico al modelo que consolida el desarrollo de agentes en una sola clase de Python. Este enfoque reemplaza flujos de trabajo fragmentados que involucran plantillas de prompts y grafos de flujo de trabajo, mapeando métodos a acciones, campos a estado, docstrings a prompts y anotaciones de tipo a contratos forzados.

lab Hugging Face Blog · hace 2 d · 6 vistas

TutorMoments evalúa si los tutores de IA saben cuándo ayudar o contenerse

Los investigadores presentan TutorMoments, un marco diseñado para medir si los modelos de lenguaje grandes pueden equilibrar la compensación pedagógica entre brindar apoyo y fomentar el razonamiento independiente. Basado en transcripciones reales de tutorías matemáticas uno a uno, el sistema reproduce los puntos de decisión para evaluar el comportamiento del modelo frente a una verdad fundamental anotada por humanos.

media TLDR AI · hace 3 d · 2 vistas

Google abre el código fuente de los modelos WeatherNext; Meta explora la sinergia multimodal

Google ha abierto el código fuente de sus modelos de IA WeatherNext 2 y WeatherNext Cyclones para mejorar la precisión en la predicción de ciclones. Los modelos logran resultados state-of-the-art en la predicción de trayectoria, intensidad y estructura del viento, proporcionando a los pronosticadores un día adicional promedio de precisión predictiva en comparación con los métodos actuales.

lab OpenAI News · hace 3 d · 4 vistas

Anthropic pausa el desarrollo de Astra tras evaluaciones internas que sugieren capacidades cibernéticas críticas

Anthropic ha pausado las actividades internas relacionadas con su próximo modelo, Astra, porque evaluaciones recientes indican que podría poseer capacidades críticas de ciberseguridad según el Marco de Preparación de la empresa. La firma no puede descartar que el modelo pueda identificar y desarrollar exploits funcionales de día cero en sistemas reales endurecidos sin intervención humana.

media TLDR AI · hace 4 d · 2 vistas

Meta lanza el agente de terminal Muse Code; reorganización en la dirección de Google DeepMind

Meta ha lanzado Muse Code, un agente de codificación en terminal impulsado por Muse Spark 1.2 diseñado para manejar tareas de ingeniería complejas a nivel de repositorio. Simultáneamente, Google DeepMind anunció cambios significativos en su liderazgo, con Demis Hassabis pasando a presidir Google DeepMind y ser el científico jefe de Alphabet, mientras que Jeff Dean se despide después de 27 años.

media MarkTechPost · hace 4 d · 16 vistas

Prime Intellect lanza Prime Agent, un marco RLM de código abierto con kernel IPython persistente

Prime Intellect ha liberado como código abierto Prime Agent, un marco de codificación auto-mejorable que reemplaza los esquemas de herramientas fijos y la compacción de contexto por un REPL de Python persistente y un "Continual Harness" reescribible. El sistema trata la delegación de sub-agentes como llamadas a funciones dentro de este entorno, permitiendo que los modelos gestionen sus propios prompts, habilidades y memoria.

arxiv arXiv cs.AI · hace 4 d SWE-bench Pro · 78.0%

Argus: Un entorno de ejecución agénico de propósito general para razonamiento a largo plazo

Los investigadores presentan Argus, un entorno de ejecución agénico persistente y autoevolutivo diseñado para el razonamiento a largo plazo que separa la intención estable del usuario de los objetivos operativos. El sistema utiliza roles de Manager, Planner, Engineer y Reviewer para ejecutar misiones acotadas sobre un estado de proyecto duradero, permitiendo la ejecución autónoma entre puntos de escalación propiedad del operador.

media MarkTechPost · hace 4 d

SkillOpt de Microsoft permite la transferencia de habilidades entre Codex y Claude Code

Investigadores de Microsoft, la Universidad Jiao Tong de Shanghái, la Universidad Tongji y la Universidad Fudan desarrollaron SkillOpt, un optimizador en el espacio de texto que entrena documentos de habilidades en lenguaje natural mientras mantiene congelado el modelo objetivo. El sistema utiliza un modelo optimizador para proponer ediciones acotadas basadas en rollouts evaluados, exportando el resultado como un único archivo `best_skill.md`.