Fuente · arXiv cs.LG
arxiv arXiv cs.LG · hace 13 d · 2 vistas

Moonshot AI lanza Kimi K3, un modelo MoE de 2.8T parámetros con contexto de millón de tokens

Moonshot AI ha presentado Kimi K3, un modelo Mixture-of-Experts de código abierto que cuenta con 2.8 billones de parámetros totales y 104 mil millones de parámetros activados por token. El modelo admite capacidades nativas de visión y una ventana de contexto de 1 millón de tokens, aprovechando Kimi Delta Attention y Stable LatentMoE para lograr una eficiencia de escalado aproximada de 2.5x en comparación con su predecesor, Kimi K2.

arxiv arXiv cs.LG · hace 3 d

U-OPSD permite la auto-distilación no supervisada en política para LLM

Los investigadores proponen la Auto-Distilación No Supervisada en Política (U-OPSD), un método que logra una mejora post-entrenamiento para modelos de lenguaje grandes utilizando únicamente las propias generaciones del modelo sin supervisión externa. El enfoque muestrea múltiples trayectorias para construir una pseudo-solución mediante votación mayoritaria, luego destila una distribución docente en los prefijos de la finalización incorrecta más larga del modelo.

arxiv arXiv cs.LG · hace 6 d OSWorld 2.0 · 21.2% · 6 vistas

Qwen lanza Qwen-CUA, un agente de uso nativo del ordenador de 397B-A17B

Qwen presenta Qwen-CUA, un agente de uso nativo del ordenador basado en una columna vertebral de mezcla de expertos de 397B-A17B que opera mediante capturas de pantalla y eventos de entrada sin depender de árboles DOM ni metadatos de accesibilidad. El sistema utiliza un andamio para mantener hasta 20 capturas de pantalla activas y fue entrenado utilizando una flota de despliegue en la nube con casi 100.000 vCPUs a lo largo de aproximadamente 40.000 tareas verificables.

arxiv arXiv cs.LG · hace 19 d · 4 vistas

SkewAdam utiliza un estado de optimizador en niveles para reducir la memoria de entrenamiento MoE en un 97%

Los investigadores presentan SkewAdam, un optimizador diseñado para modelos de mezcla de expertos (MoE) que asigna diferentes tipos de estado a poblaciones de parámetros distintas para reducir drásticamente el uso de memoria. Al asignar momento float32 y momentos segundos factorizados al núcleo principal, momentos segundos factorizados a los expertos y momentos segundos exactos al enrutador, SkewAdam reduce el estado del optimizador de 50.6 GB a 1.29 GB para un modelo de 6.78B parámetros.

arxiv arXiv cs.LG · hace 24 d · 2 vistas

RoboTTT escala las políticas de robots a un contexto de 8K pasos de tiempo

Los investigadores presentan RoboTTT, una receta de entrenamiento que extiende el contexto visuomotor para modelos base de robots hasta 8.000 pasos de tiempo sin aumentar la latencia de inferencia. El método integra el Entrenamiento en Tiempo de Prueba (Test-Time Training) en políticas Visión-Lenguaje-Acción mediante el uso de pesos rápidos actualizados por descenso de gradiente durante tanto el entrenamiento como la inferencia.

arxiv arXiv cs.LG · hace 24 d BrowseComp · 42.6% · 1 vista

TRACE mejora el uso de herramientas en agentes de horizonte largo mediante estimación de crédito por turno

Los autores proponen TRACE (Turn-level Reward Assignment via Credit Estimation), un método de asignación de crédito denso para el aprendizaje por refuerzo agéntico que aborda la escasez y alta varianza de las recompensas de resultado en tareas de horizonte largo. Al representar los rollouts como transiciones de estado en los límites de llamadas a herramientas y derivar recompensas por acción a partir de valores de estado con log-ratio, TRACE permite un entrenamiento efectivo sin críticos adicionales ni etapas de ajuste fino supervisado.

arxiv arXiv cs.LG · hace 25 d

TerraZero: simulador de conducción procedural permite auto-juego a escala sin demostraciones

Los investigadores presentan TerraZero, un simulador de conducción procedural y una pila de entrenamiento por auto-juego diseñada para entrenar agentes robustos de conducción autónoma sin demostraciones humanas. El sistema utiliza un motor C configurable para ejecutar la simulación en la CPU y la inferencia de políticas en la GPU a través de un camino de copia cero, sosteniendo 1,3M pasos de agente por segundo en una única GPU de grado servidor.

arxiv arXiv cs.LG · hace 26 d

REGRIND aprende manipulación diestra a partir de una única demostración humana

Los autores presentan REGRIND, una canalización de aprendizaje por refuerzo guiada por retargeting que es minimalista y aprende políticas de manipulación diestra a partir de una única demostración humana. El método reorienta el movimiento humano del objeto al robot preservando las relaciones espaciales y de contacto, luego entrena una política residual de RL en simulación para rastrear puntos clave centrados en el objeto.

arxiv arXiv cs.LG · hace 24 d

VAE de Bayes Empírico Multimodal para modelado conjunto longitudinal y de tiempo hasta evento

Los autores extienden el framework del autoencoder variacional de Bayes empírico (EB-VAE) para modelar conjuntamente las mediciones longitudinales del tumor y los datos de abandono por tiempo hasta evento. El enfoque utiliza una prior condicionada a covariables para representar la variabilidad interindividual y augmenta el decodificador con un modelo de riesgo para tener en cuenta el abandono informativo.

arxiv arXiv cs.LG · hace 24 d · 1 vista

Exponente de Lyapunov como recompensa densa informada por física: descubrimiento de estabilización en RL más allá del péndulo de Kapitza

Los autores proponen utilizar el exponente característico de Lyapunov (LCE) como una señal de recompensa densa para estabilizar un péndulo invertido con movimiento vertical. Este enfoque permite que los agentes de aprendizaje por refuerzo descubran comportamientos de estabilización complejos más allá de las soluciones oscilatorias estándar.

arxiv arXiv cs.LG · hace 25 d Terminal-Bench · 76.4%

La optimización de RELAI-VCL obtiene ventajas en Terminal-Bench 2.0

Un estudio evalúa si las ganancias por optimización de agentes se acumulan con el tiempo al probar tres métodos — GEPA, Meta Harness y RELAI-VCL — en las tareas difíciles de Terminal-Bench 2.0. Aunque todos los métodos mejoran una línea base estática, solo RELAI-VCL transfiere exitosamente a tareas no vistas y continúa mejorando después de rondas posteriores de optimización.

arxiv arXiv cs.LG · hace 25 d

El diseño del bloque de alimentación directa del Transformer preserva el rango del gradiente a lo largo de la profundidad

El artículo investiga cómo los componentes de la arquitectura del bloque de alimentación directa del Transformer determinan la cantidad de rango que sobrevive en toda la profundidad durante la inicialización. Reinterpreta las conexiones residuales y la normalización como mecanismos para preservar el rango del gradiente, que de otro modo se reduce por las multiplicaciones de matrices y las activaciones no lineales.

arxiv arXiv cs.LG · hace 25 d

CSFS reduce el costo de selección de características para la predicción de energía eólica y solar en un 21%

Los investigadores proponen la Selección Secuencial de Características basada en Clústeres (CSFS), un nuevo método envolvente basado en clústeres para la selección automática y eficiente de características en pipelines de predicción de energías renovables. El enfoque aborda la falta de métodos sistemáticos para seleccionar características de entrada entre el gran número de variables de monitoreo y ambientales disponibles.

arxiv arXiv cs.LG · hace 25 d · 1 vista

El estudio encuentra que la adopción de herramientas de codificación agéntica es baja y está concentrada en proyectos pequeños de GitHub

Un análisis reciente de 25.264 pull requests agénticos en 2.361 repositorios populares de GitHub revela que la adopción intensiva de herramientas de codificación agéntica sigue limitada a un pequeño subconjunto de proyectos de código abierto. El estudio indica que el repositorio mediano genera solo uno o dos PRs durante un período de tres meses.

arxiv arXiv cs.LG · hace 25 d · 1 vista

Enrutamiento de múltiples expertos para OCR multirreino con pocos recursos: un estudio de caso manchu

El artículo presenta un sistema de múltiples expertos para OCR manchú histórico que maneja estilos de escritura visualmente distintos como la escritura regular, la cursiva y la caligrafía semicursiva de cancillería a pesar de los datos etiquetados limitados. El enfoque reutiliza puntos de control de un proceso de ajuste fino iterativo como especialistas de dominio y emplea un clasificador de imágenes ligero a nivel de página para enviar páginas basándose en el estilo visual.

arxiv arXiv cs.LG · hace 25 d

Evo 2 detecta resistencia antimicrobiana en datos metagenómicos con alta precisión

Los investigadores evaluaron el potencial de bioseguridad de los modelos fundacionales genómicos entrenando sondas lineales y de atención sobre las activaciones congeladas de la capa-26 de Evo 2 para detectar resistencia antimicrobiana (AMR) en datos metagenómicos. El estudio encontró que estas sondas ligeras pueden detectar AMR con una fuerte discriminación, logrando un ROC-AUC a nivel de región de 0.977 utilizando una sonda de atención de cabeza única.

arxiv arXiv cs.LG · hace 25 d

MetaPerch utiliza metadatos auxiliares para mejorar los modelos fundamentales de bioacústica

Los investigadores presentan MetaPerch, un nuevo modelo fundamental de bioacústica que aprovecha los metadatos de grabación, como ubicación y tiempo, como señales de supervisión auxiliares junto con las vocalizaciones. Este enfoque permite al modelo utilizar correlaciones entre especies y metadatos, fomentando representaciones más ricas que se generalizan mejor a la distribución de especies y a los cambios en el dominio acústico.

arxiv arXiv cs.LG · hace 25 d

OT-ICA utiliza transporte óptimo para recuperar componentes independientes

Los autores proponen OT-ICA, un nuevo algoritmo para el Análisis de Componentes Independientes Lineal que mide la no-gaussianidad utilizando la distancia de Wasserstein al cuadrado hacia una gaussiana estándar en lugar de funciones de contraste proxy. Demuestran que esta distancia se maximiza cuando las proyecciones recuperan un componente independiente e implementan el método mediante optimización basada en gradientes.