Un nuevo método utiliza síntesis de programas para generar programas en Python que reproducen los patrones de atención en modelos Transformer. Estos programas logran más del 75% de similitud promedio Intersection-over-Union en datos no vistos y pueden reemplazar hasta el 25% de las cabezas de atención con impacto mínimo en el rendimiento del modelo, aumentando la perplexidad solo un 16% en promedio.
Ingeniería inversa de la atención en Transformers mediante programas ejecutables
LOGOS: Un modelo generativo de propósito general para las ciencias naturales
LOGOS es un modelo de lenguaje generativo unificado que representa objetos científicos y sus interacciones como secuencias de tokens en una gramática compartida. Logra un rendimiento consistente o superior en diversas tareas de ciencias naturales, demostrando la viabilidad de un único modelo que sirva a múltiples dominios. El modelo escala positivamente con el número de parámetros, y su diseño sugiere que la IA para la ciencia debería alinearse profundamente con los grandes modelos de lenguaje a través de arquitecturas compartidas y entrenamiento.
Claude de Anthropic mejora el límite de la hipótesis de Riemann; Meta lanza Muse Glimmer; OpenAI presenta GPT-5.6-Cyber
Esta edición de TLDR AI cubre tres desarrollos importantes: el modelo Claude de Anthropic mejoró significativamente el límite inferior para los ceros que satisfacen la hipótesis de Riemann, Meta lanzó el modelo de peso abierto Muse Glimmer y OpenAI presentó un modelo especializado en ciberseguridad.
Actualizaciones de Muse Spark 1.2 de Meta y GPT-5.6 Sol de OpenAI
Meta anunció que su modelo Muse Spark 1.2 logró un rendimiento de medalla de oro en cinco Olimpiadas de STEM y entró en el top 5 del Índice Vals a $0.69/prueba, según se informa, 3 veces más barato que Kimi. Meta atribuyó estas ganancias a la orquestación multiagente con razonamiento paralelo, destacando puntuaciones perfectas en teoría en APhO e IPhO sin herramientas externas.
La dirección en tiempo de prueba resuelve conflictos de hechos temporales en LLMs
Los investigadores identifican conflictos temporales paramétricos en modelos de lenguaje donde los hechos desactualizados persisten en los parámetros. Introducen la Dirección Atractora Temporal (TAS), un método en tiempo de prueba que resuelve del 29% al 57% de estos conflictos sin reentrenamiento, manteniendo una precisión del 85-99% en consultas sin conflicto y superando a una línea base en tres de cuatro modelos.
La Universidad Estatal de Ohio lanza el agente de investigación profunda QUEST-35B de código abierto
El equipo de PLN de la Universidad Estatal de Ohio ha lanzado QUEST-35B, un agente de investigación profunda de código abierto entrenado en aproximadamente 32 GPUs H100 utilizando 8.000 muestras sintéticas. El equipo ha liberado como código abierto la receta de entrenamiento, el código, los pesos y los conjuntos de datos, con resultados de evaluación que muestran un rendimiento competitivo en comparación con los principales sistemas de investigación profunda de código cerrado.