Ternary Mamba logra una compresión de 3.61x de Mamba-2 mediante entrenamiento cuantizado con conciencia de cuantización agrupado desde un checkpoint preentrenado, reduciendo la memoria de 2,687 a 744 MB. Alcanza una precisión zero-shot del 48.1% con solo 102M tokens y 4 GPU-hours, igualando a Bi-Mamba dentro de 0.9 puntos porcentuales, mientras revela nueva inestabilidad de las escalas de cuantización aprendibles y acumulación de errores en la recurrencia.
Ternary Mamba: QAT preentrenada para compresión eficiente de SSM
Ternary Mamba: QAT eficiente de SSMs desde checkpoints preentrenados
Ternary Mamba logra una compresión de 3.61x de Mamba-2, pasando de 2,687 a 744 MB mediante entrenamiento con conciencia de cuantificación agrupada y destilación de conocimiento. Alcanza una precisión zero-shot del 48.1% en 7 tareas con 102M tokens, igualando a Bi-Mamba dentro de 0.9 puntos porcentuales, mientras evita el costoso entrenamiento desde cero.
Acumulación de Ventaja Marginal para la Autoevolución de Agentes Impulsada por Memoria
Este artículo presenta la Acumulación de Ventaja Marginal (MAA), una arquitectura de postprocesamiento que aborda la inconsistencia entre lotes en la autoevolución de agentes impulsada por memoria. MAA formaliza la alineación y comparabilidad como condiciones estructurales, utiliza señales diferenciales y promedio móvil exponencial para acumular evidencia firmada por operación, y garantiza la trazabilidad mediante la fusión de identidad semántica. Supera a las líneas base a nivel de lote en 14 de cada 16 configuraciones y reduce el consumo de tokens en aproximadamente un 75%.
Por qué la escalabilidad de IA es un problema de sistemas, no solo una carrera de GPUs
El debate sobre la escalabilidad de IA pasa por alto que maximizar la utilización de FLOP del modelo es más crítico que comprar más GPUs. Fronteras como xAI operan con MFU inferior al 10%, mientras que modelos históricos lograron entre 21% y 70% de MFU, lo que indica ineficiencias sistémicas en la programación, la red y la gestión del clúster. Anjney Midha argumenta que la infraestructura de IA debe evolucionar hacia sistemas eficientes, alineados y responsables, con el 'output maxing' emergiendo como una nueva disciplina para la IA de frontera.
El RL guiado por discriminador corrige el emparejamiento de flujos con recompensas alineadas a los datos
El RL guiado por discriminador (DRL) utiliza un espacio de representaciones preentrenado para entrenar un discriminador que separa los datos reales de las muestras generadas por el modelo. Su logit se usa como recompensa en el RL con regularización KL, alineando las salidas del modelo con la realismo visual y semántico sin preferencias humanas. DRL mejora FID y FD semántico en modelos como SiT y JiT, y mejora la frontera de Pareto entre preferencia y fidelidad.
ConSA: Control de Esparsidad Aprendible en Atención Híbrida
ConSA introduce un marco que aprende la asignación óptima de atención completa frente a ventana deslizante mediante regularización L0 y restricciones de Lagrangiano aumentado. Supera a los métodos basados en reglas, con SWA ubicado en las capas inferiores y FA concentrado en bloques de capas intermedias, un patrón consistente a través de escalas de modelo y niveles de esparsidad.