Laboratorio · Zhipu AI
arxiv arXiv cs.CL · hace 10 d · 2 vistas

OSReward introduce una evaluación estandarizada para modelos de recompensa de uso de computadora multiplataforma

Los investigadores presentan OSReward, un benchmark realista diseñado para evaluar la fiabilidad de los modelos de visión y lenguaje (VLM) que actúan como jueces para trayectorias de agentes que utilizan computadoras. El estudio revela que incluso los VLM más avanzados adolecen de un sesgo sistemático de indulgencia y suelen ser demasiado costosos para su escalado, mientras que los modelos abiertos asequibles tienen un rendimiento deficiente.

media TLDR AI · hace 11 d · 4 vistas

xAI lanza el Modo Construcción; investigadores instan a un pacto de desaceleración de la IA

xAI ha lanzado el "Modo Construcción" para suscriptores de SuperGrok Heavy, permitiendo a los usuarios generar, editar, previsualizar y publicar sitios web, aplicaciones, juegos y paneles de control directamente desde el chat sin configuración. Simultáneamente, más de mil empleados de empresas de IA de vanguardia han firmado un manifiesto solicitando que el gobierno de EE. UU. apoye un esfuerzo internacional para desarrollar herramientas que regulen deliberadamente el ritmo del avance en el desarrollo automatizado de IA.

arxiv arXiv cs.CL · hace 13 d · 2 vistas

PIVOT comparte escaneos de prefijo entre grupos de consultas para acelerar la atención dispersa a nivel de token

PIVOT (Proxy Indexing Via One full-prefix Traversal) es una solución sin entrenamiento y de inserción directa para el indexador DeepSeek Sparse Attention (DSA) que reduce la redundancia computacional compartiendo un solo escaneo de prefijo entre un grupo de consultas cercanas. En lugar de puntuar cada token precedente para cada consulta individualmente, PIVOT agrega el grupo en una única consulta proxy para obtener un conjunto candidato, del cual se seleccionan los top-k tokens para cada consulta.

arxiv arXiv cs.CL · hace 13 d

El marco Zing mejora la inteligencia social de los LLM mediante el benchmark SoMBench y la fundamentación Actio

El informe presenta Zing, un marco integrado diseñado para mejorar la inteligencia social de los modelos de lenguaje grandes mediante la medición, internalización y fundamentación de las capacidades sociales. Los autores presentan SoMBench, un benchmark basado en psicología que abarca 17 dimensiones secundarias y 3.481 instancias verificadas por expertos, el cual revela que los LLM actuales tienen un margen significativo de mejora, sin que ningún modelo alcance un rendimiento cercano al máximo.

media r/LocalLLaMA · hace 26 d · 1 vista

SAO introduce optimización asíncrona de un solo rollout para un entrenamiento estable de RL agéntico

El artículo presenta Single-rollout Asynchronous Optimization (SAO), un método diseñado para abordar los desafíos de estabilidad y fuera de política en el aprendizaje por refuerzo asíncrono para grandes modelos de lenguaje. Al reemplazar el muestreo grupal con muestreo de un solo rollout, el enfoque reduce los efectos fuera de política y mejora la generalización durante las tareas agénticas de largo plazo.