LegalHalluLens introduce un marco para auditar alucinaciones de la IA en contextos legales mediante el análisis de perfiles de alucinación tipificados en cuatro categorías de afirmaciones. Revela una brecha de 38-40 puntos entre las afirmaciones obligatorias/numéricas y temporales, y muestra que dos sistemas con tasas de alucinación idénticas del 52% pueden tener direcciones de riesgo opuestas. El marco utiliza un Índice de Dirección de Riesgo y pipelines de debate calibrados para reducir las detecciones fabricadas en un 45% y mejorar la responsabilidad en el despliegue de IA legal.
LegalHalluLens: Auditoría de alucinaciones en IA legal
Investigadores explotan la reutilización de cifrado entre sesiones para robar trazas de razonamiento de APIs de LLM
Los investigadores han identificado una vulnerabilidad en cómo los principales proveedores de modelos de lenguaje grandes manejan las trazas de razonamiento paso a paso, que se devuelven como bloques cifrados para uso del lado del cliente. Descubrieron que estos bloques cifrados son completamente compatibles e intercambiables entre diferentes sesiones, usuarios y modelos dentro del ecosistema del mismo proveedor.
NRT-Bench: Red-teaming multi-turn de agentes LLM en sistemas críticos para la seguridad
NRT-Bench presenta un benchmark para el red-teaming multi-turn de agentes LLM que operan en una planta de energía nuclear simulada. En cuatro modelos de operador de vanguardia, entre el 8,7 % y el 12,1 % de las sesiones de ataque provocan la pérdida de una función crítica de seguridad, con vulnerabilidades en gran medida disjuntas entre los modelos. La efectividad de las defensas varía significativamente según el modelo, mostrando una fuerte dependencia del modelo.
Desvío defensivo contra ataques automatizados en IA agéntica
Los sistemas de IA agéntica enfrentan crecientes amenazas por parte de ataques automatizados guiados por modelos. Una nueva estrategia de defensa, Desvío Contextual mediante Compromiso Progresivo (CMPE), reduce las tasas de éxito del atacante hasta en dos órdenes de magnitud y casi elimina el éxito verificado del ataque en pruebas de referencia.
LedgerAgent: Estado estructurado para agentes de llamada de herramientas adherentes a la política
LedgerAgent introduce un libro mayor estructurado para mantener los estados de las tareas por separado en agentes de llamada de herramientas. Convierte los estados en prompts y aplica restricciones de la política antes de la ejecución de herramientas, reduciendo las violaciones de la política y mejorando el rendimiento en dominios de atención al cliente.
LedgerAgent: Estado estructurado para agentes de llamada a herramientas adherentes a la política
LedgerAgent introduce un libro contable estructurado para mantener los estados de las tareas separados en agentes que llaman a herramientas. Convierte estos estados en prompts y aplica restricciones de políticas antes de la ejecución de las herramientas, reduciendo las violaciones de políticas y mejorando el rendimiento en dominios de atención al cliente.