Approxima es un agente QA de código abierto y autoalojable que supervisa los recorridos del usuario y soporta Claude, Gemini y GPT de forma nativa. Cuenta con Modo Exploración, Pruebas A/B y Auto-reparación para adaptarse a la evolución del producto, con soporte completo para modelos locales y contribuciones de la comunidad.
Hemos abierto el código de nuestro agente QA basado en LLM para detectar fallos más rápido
Claude de Anthropic mejora el límite de la hipótesis de Riemann; Meta lanza Muse Glimmer; OpenAI presenta GPT-5.6-Cyber
Esta edición de TLDR AI cubre tres desarrollos importantes: el modelo Claude de Anthropic mejoró significativamente el límite inferior para los ceros que satisfacen la hipótesis de Riemann, Meta lanzó el modelo de peso abierto Muse Glimmer y OpenAI presentó un modelo especializado en ciberseguridad.
Lanzamiento de Inkling-Small, recortes de precios de GPT-5.6, Gemini Robotics ER 2
Thinking Machines lanzó Inkling-Small, un modelo mixture-of-experts con 276B de parámetros y 12B activos, que conserva el razonamiento multimodal y una ventana de contexto de 1M de tokens mientras utiliza menos recursos computacionales.
GPT-5 supera a los humanos en la inducción de estados de creencia mediante planificación
Un nuevo estudio evalúa la capacidad de los Modelos de Lenguaje Grande (LLM) para inducir estados de creencia específicos en otros agentes mediante acciones en lugar de conversación, una capacidad denominada ToM de Planificación No Conversacional (NCP-ToM). Utilizando el marco NCP-ExploreToM, los investigadores probaron seis modelos de vanguardia y participantes humanos en 600 instancias de tareas donde los agentes debían mover objetos o dirigir personajes para lograr objetivos de creencia.
El Reglamento de IA de la UE exige marcas de agua en textos generados por IA desde agosto de 2024
El Reglamento de IA de la UE requiere que todos los sistemas de IA que generen texto sintético incluyan marcas de agua legibles por máquina y detectables, utilizando soluciones técnicas robustas e interoperables con dos capas. Esto se aplica a todos los modelos de IA, incluidos los de código abierto, y se extiende a cualquier servicio accesible por ciudadanos de la UE, independientemente de su ubicación. El incumplimiento conlleva multas de hasta 35 millones de euros o un porcentaje de los ingresos anuales, y los proveedores de modelos de IA de 'riesgo sistémico' enfrentan una mayor responsabilidad.
La Universidad Estatal de Ohio lanza el agente de investigación profunda QUEST-35B de código abierto
El equipo de PLN de la Universidad Estatal de Ohio ha lanzado QUEST-35B, un agente de investigación profunda de código abierto entrenado en aproximadamente 32 GPUs H100 utilizando 8.000 muestras sintéticas. El equipo ha liberado como código abierto la receta de entrenamiento, el código, los pesos y los conjuntos de datos, con resultados de evaluación que muestran un rendimiento competitivo en comparación con los principales sistemas de investigación profunda de código cerrado.