La documentación oficial de Zhipu GLM-5.3 apareció brevemente en línea
Ha aparecido la documentación del próximo modelo GLM-5.3 de Zhipu y fue eliminada segundos después. Las páginas fueron indexadas por Bing antes de desaparecer.
Ha aparecido la documentación del próximo modelo GLM-5.3 de Zhipu y fue eliminada segundos después. Las páginas fueron indexadas por Bing antes de desaparecer.
Se ha identificado una rama de commits para GLM 5.3 en el repositorio z-ai-sdk-java en GitHub.
El nuevo modelo DeepSeek V4-Flash ha logrado una puntuación de 50 en el Índice de ArtificialAnalysis. Este resultado lo sitúa a solo un punto por debajo de GLM-5.2 y GPT-5.6 Luna.
Los investigadores presentan OSReward, un benchmark realista diseñado para evaluar la fiabilidad de los modelos de visión y lenguaje (VLM) que actúan como jueces para trayectorias de agentes que utilizan computadoras. El estudio revela que incluso los VLM más avanzados adolecen de un sesgo sistemático de indulgencia y suelen ser demasiado costosos para su escalado, mientras que los modelos abiertos asequibles tienen un rendimiento deficiente.
xAI ha lanzado el "Modo Construcción" para suscriptores de SuperGrok Heavy, permitiendo a los usuarios generar, editar, previsualizar y publicar sitios web, aplicaciones, juegos y paneles de control directamente desde el chat sin configuración. Simultáneamente, más de mil empleados de empresas de IA de vanguardia han firmado un manifiesto solicitando que el gobierno de EE. UU. apoye un esfuerzo internacional para desarrollar herramientas que regulen deliberadamente el ritmo del avance en el desarrollo automatizado de IA.
El proyecto llama.cpp ha lanzado la compilación b10174, introduciendo soporte de descodificación especulativa NextN/MTP para la arquitectura del modelo GLM_DSA (GLM-5.2).
Moonshot ha publicado los detalles completos, los pesos y la infraestructura de soporte para Kimi K3, un modelo Mixture-of-Experts de 2.8T parámetros con aproximadamente 104B parámetros activos por token. El lanzamiento incluye informes técnicos que detallan su pila híbrida de contexto largo y nuevas herramientas como MoonEP, FlashKDA y AgentEnv.
PIVOT (Proxy Indexing Via One full-prefix Traversal) es una solución sin entrenamiento y de inserción directa para el indexador DeepSeek Sparse Attention (DSA) que reduce la redundancia computacional compartiendo un solo escaneo de prefijo entre un grupo de consultas cercanas. En lugar de puntuar cada token precedente para cada consulta individualmente, PIVOT agrega el grupo en una única consulta proxy para obtener un conjunto candidato, del cual se seleccionan los top-k tokens para cada consulta.
El informe presenta Zing, un marco integrado diseñado para mejorar la inteligencia social de los modelos de lenguaje grandes mediante la medición, internalización y fundamentación de las capacidades sociales. Los autores presentan SoMBench, un benchmark basado en psicología que abarca 17 dimensiones secundarias y 3.481 instancias verificadas por expertos, el cual revela que los LLM actuales tienen un margen significativo de mejora, sin que ningún modelo alcance un rendimiento cercano al máximo.
Una comparación de tres modelos Mixture-of-Experts de pesos abiertos—Kimi K3 de Moonshot AI, DeepSeek V4 Pro y GLM-5.2 de Zhipu AI—evalúa sus capacidades, términos de licencia y costos de servicio para cargas de trabajo de codificación y agentes a largo plazo.
El artículo presenta Single-rollout Asynchronous Optimization (SAO), un método diseñado para abordar los desafíos de estabilidad y fuera de política en el aprendizaje por refuerzo asíncrono para grandes modelos de lenguaje. Al reemplazar el muestreo grupal con muestreo de un solo rollout, el enfoque reduce los efectos fuera de política y mejora la generalización durante las tareas agénticas de largo plazo.
Uno de los fundadores de Z.ai, la empresa detrás del recientemente lanzado GLM 5.2, ha compartido un spoiler que indica que está por llegar un nuevo modelo GLM.
El fundador de Zhipu ha apoyado públicamente el movimiento de inteligencia artificial de código abierto en medio de un creciente debate global sobre la seguridad de la IA.