Laboratorio · Zhipu AI
media Together AI Blog · hace 26 d · 51 vistas

La destilación de GLM-5.3 Flash intercambia consistencia por una reducción de costo de 17x

Una comparación de GLM-5.3 y su variante destilada, GLM-5.3 Flash, en el benchmark DeepSWE revela que la destilación preserva la capacidad central de codificación mientras reduce significativamente los costos de rollout. El modelo completo logra una tasa de pass@1 del 69.0% a $3.99 por tarea, mientras que la variante Flash obtiene un puntaje de 63.4% a solo $0.24, lo que representa una reducción de precio de 17x.

media MarkTechPost · hace 28 d · 88 vistas

Z.ai lanza GLM-5.3-Flash, un MoE multimodal de 320B-A18B con contexto de 1M

Z.ai ha lanzado GLM-5.3-Flash, el primer modelo nativamente multimodal de la serie GLM-5, que presenta una arquitectura de mezcla de expertos con 320 mil millones de parámetros totales y 18 mil millones activos por token. El modelo admite entradas de imagen y video dentro de una ventana de contexto de 1,048,576 tokens y está disponible bajo una licencia MIT en Hugging Face.

arxiv arXiv cs.CL · hace 1 d · 13 vistas

TelecomGPT-R1: Entrenamiento posterior unificado para el razonamiento en tareas de telecomunicaciones heterogéneas

Los investigadores presentan TelecomGPT-R1, una familia de modelos de razonamiento unificados de telecomunicaciones de código abierto diseñados para automatizar tareas de ingeniería mediante el razonamiento sobre estándares, configuraciones y registros. El modelo aborda las limitaciones de los LLMs existentes de propósito general y especializados a través de un enfoque estructurado que cubre ejes de protocolo, conocimiento, modelado y fallos.

arxiv arXiv cs.LG · hace 2 d HealthBench · 50.1% · 11 vistas

Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas

Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar el razonamiento diagnóstico y clínico en atención médica. El marco de entrenamiento primero aplica RL guiado por reglas a preguntas derivadas de MedBullets para el diagnóstico, luego utiliza 5.3k escenarios sintéticos multi-turno con rúbricas multidimensionales para tareas clínicas interactivas.

arxiv arXiv cs.CL · hace 7 d · 23 vistas

Modelos de vanguardia evaluados en el juego de preguntas log(N) sobre Wikipedia

Un estudio evalúa seis modelos de lenguaje de vanguardia en una tarea de comunicación entre dos agentes donde un interrogador identifica un objetivo a partir de N párrafos de Wikipedia utilizando exactamente log2(N) preguntas de sí/no. El experimento ejecutó 408 juegos en conjuntos de documentos de 4 a 1024 párrafos, revelando disparidades significativas en el rendimiento entre los modelos evaluados.

arxiv arXiv cs.CL · hace 14 d · 29 vistas

Ataque unidireccional a GLM-5.3-Flash revela fragilidad del alineamiento de seguridad en modelos MoE

Los investigadores demuestran que la ablación direccional, un ataque de caja blanca que elimina el rechazo proyectando fuera una única dirección desde los pesos, sigue siendo efectiva en modelos de vanguardia de mezcla de expertos (MoE) como GLM-5.3-Flash. El estudio muestra que, aunque el ataque sobrevive a la arquitectura, sus efectos se distribuyen entre los escritores de atención, densos y de expertos enrutados, en lugar de concentrarse en una sola ubicación.

arxiv arXiv cs.CL · hace 23 d · 39 vistas

CogEvol lanza modelo de 4B para generación eficiente de entornos de aprendizaje

CogEvol presenta una familia de modelos diseñados para convertir resúmenes de cursos en diapositivas JSON estructuradas o páginas HTML interactivas en un solo paso, reemplazando el andamiaje multi-turno de agentes. El sistema utiliza una canalización de datos basada en producción y mecanismos de recompensa híbridos para garantizar la fiabilidad durante el entrenamiento.

arxiv arXiv cs.CL · hace 23 d · 33 vistas

WebWorld utiliza el navegador como modelo del mundo para auto-mejorar el código web

Los autores presentan WebWorld, una interfaz que permite a un Modelo de Visión y Lenguaje (VLM) interactuar autónomamente con el navegador como un modelo del mundo determinista para el código web. Este enfoque aborda la falla estructural en la auto-mejora impulsada por VLM donde el modelo juzga sus propias reparaciones introduciendo una contraparte que no puede ser engañada.