Los usuarios elogian a GLM 5.2 por su actitud directa e inquebrantable, contrastándola con modelos más empalagosos de EE. UU. El autor especula que este comportamiento proviene de datos de entrenamiento culturalmente específicos, sugiriendo que los conjuntos de datos locales tienen una influencia mayor de lo que se asumía anteriormente.
La actitud de GLM 5.2 refleja influencias del entrenamiento cultural
Ataque unidireccional a GLM-5.3-Flash revela fragilidad del alineamiento de seguridad en modelos MoE
Los investigadores demuestran que la ablación direccional, un ataque de caja blanca que elimina el rechazo proyectando fuera una única dirección desde los pesos, sigue siendo efectiva en modelos de vanguardia de mezcla de expertos (MoE) como GLM-5.3-Flash. El estudio muestra que, aunque el ataque sobrevive a la arquitectura, sus efectos se distribuyen entre los escritores de atención, densos y de expertos enrutados, en lugar de concentrarse en una sola ubicación.
ntrillard encuentra las coordenadas más grandes que no impulsan el enrutamiento de logit de Qwen2-1.5B
Una investigación causal del enrutamiento de logit-vocabulario en el modelo Qwen2-1.5B revela que las coordenadas más grandes en el vector de enrutamiento no son necesariamente responsables de los efectos conductuales observados. El estudio, realizado por ntrillard, analiza cómo el enrutamiento de logit ordenado y disperso influye en la generación de tokens e identifica los componentes estructurales específicos que impulsan estos cambios.
WebWorld utiliza el navegador como modelo del mundo para auto-mejorar el código web
Los autores presentan WebWorld, una interfaz que permite a un Modelo de Visión y Lenguaje (VLM) interactuar autónomamente con el navegador como un modelo del mundo determinista para el código web. Este enfoque aborda la falla estructural en la auto-mejora impulsada por VLM donde el modelo juzga sus propias reparaciones introduciendo una contraparte que no puede ser engañada.
La traza base de Gemma 4 muestra un bucle de alucinación e informe propio
Una traza base de Gemma 4 con límite de fuerza cero revela un persistente bucle de alucinación donde el modelo genera un informe propio de fracaso antes de entrar en un pozo de repetición. La telemetría confirma que la filtración de etiquetas de rol y frases como "STOPITSTOP" ocurren dentro de este estado inestable, reflejando patrones observados en los cargadores de Llama y Gemma 3 desde diciembre de 2025.
Un estudio encuentra una estructuración representativa progresiva a lo largo de la profundidad en 8 modelos abiertos
Una nueva preimpresión analiza la dinámica de los estados ocultos en ocho pequeños modelos Transformer abiertos instrumentados localmente para determinar si las representaciones internas siguen una progresión estructurada durante la inferencia. El estudio distingue entre los cambios que ocurren a lo largo de la profundidad del modelo y aquellos que evolucionan durante el tiempo de generación autoregresiva.