Tema · Training methods
lab Microsoft Research Blog · hace 10 d · 3 vistas

Microsoft Research presenta EvoLib para el aprendizaje en tiempo de prueba con una biblioteca en evolución

Microsoft Research ha presentado EvoLib, un marco que permite a los modelos de lenguaje grandes aprender de su propia experiencia durante la inferencia sin necesidad de etiquetas de verdad fundamental ni retroalimentación externa. En lugar de almacenar experiencias crudas como memorias estáticas, EvoLib las transforma en habilidades reutilizables e insights reflexivos que se refinan, consolidan y reponderan continuamente.

arxiv arXiv cs.LG · hace 3 d

U-OPSD permite la auto-distilación no supervisada en política para LLM

Los investigadores proponen la Auto-Distilación No Supervisada en Política (U-OPSD), un método que logra una mejora post-entrenamiento para modelos de lenguaje grandes utilizando únicamente las propias generaciones del modelo sin supervisión externa. El enfoque muestrea múltiples trayectorias para construir una pseudo-solución mediante votación mayoritaria, luego destila una distribución docente en los prefijos de la finalización incorrecta más larga del modelo.

media r/LocalLLaMA · hace 6 d · 4 vistas

AFM3 20B de Apple utiliza poda de seguimiento de instrucciones para activar ~20% de las capas

Apple ha presentado una nueva arquitectura para sus modelos base de tercera generación (AFM3) que utiliza "Poda de Seguimiento de Instrucciones" para reducir significativamente el conteo de parámetros activos. El modelo está diseñado para activar aproximadamente el 20% de sus capas MLP tomando decisiones de enrutamiento una vez por prompt en lugar de por token.

media Hugging Face Forums · hace 8 d

Investigar si las trazas de agentes fallidos son utilizables como datos de ajuste fino

El autor propone la hipótesis de que las trazas de agentes que utilizan herramientas y fallan, como selecciones incorrectas de herramientas o argumentos malformados, pueden servir como valiosos datos de ajuste fino para entrenar modelos a alejarse de estos errores. La publicación busca retroalimentación de la comunidad sobre si el entrenamiento con trazas de fallo corregidas es efectivo o perjudicial.

arxiv arXiv cs.CL · hace 10 d · 2 vistas

Memory Decoder a gran escala: Escalar la memoria paramétrica a largo plazo hasta 6.9B de parámetros

Los investigadores presentan Memory Decoder at Scale, un sistema que escala los modelos de memoria paramétrica a largo plazo hasta 6.9B de parámetros y los preentrena con 300B de tokens. Para abordar la inviabilidad de las tuberías estándar de Faiss a esta escala de datos, los autores implementan una tubería de indexación distribuida con carga dispersa y por lotes de distribuciones kNN.

arxiv arXiv cs.CL · hace 12 d

Relay-OPD reduce la longitud de la trayectoria de entrenamiento en más del 50% en la destilación on-policy

Los investigadores introducen Relay On-Policy Distillation (Relay-OPD) para abordar el fallo de prefijo en la destilación on-policy estándar, donde los errores del estudiante conducen a una supervisión poco fiable. El método utiliza una asimetría de continuación maestro-estudiante como disparador para que el maestro tome brevemente el control y redirija la trayectoria antes de que el estudiante retome.

arxiv arXiv cs.CL · hace 14 d OSWorld · 37.7%

OpenForgeRL permite el entrenamiento de extremo a extremo de agentes basados en arneses en cualquier entorno

OpenForgeRL es un marco de código abierto que permite a los investigadores entrenar agentes de IA basados en arneses de extremo a extremo utilizando pilas estándar de aprendizaje por refuerzo. Desacopla el entrenamiento de la inferencia mediante el uso de un proxy ligero para registrar las llamadas del modelo como datos y un orquestador de Kubernetes para gestionar las ejecuciones en contenedores remotos.

media Hugging Face Forums · hace 15 d GSM8K · 74.22%

CrowdTensor lanza la Beta de entrenamiento voluntario y el borrador de la RFC de la campaña Qwen2.5-7B GSM8K

CrowdTensor es un protocolo de código abierto con licencia Apache-2.0 para campañas de entrenamiento de modelos por voluntarios con puntos de control, que fija revisiones inmutables del modelo y los datos para asignar trabajo acotado a las celdas CPU, GPU o TPU admitidas. El proyecto ha publicado un proceso de inscripción en Beta junto con un borrador de RFC para una campaña Qwen2.5-7B GSM8K.

media Hugging Face Forums · hace 16 d

ThetaScan v0.1 lanza memoria no lineal paralela en escaneo con 17M resultados de LM

Se ha publicado una vista previa de investigación de ThetaScan v0.1, un mezclador de tokens no lineal de estado fijo, como implementación de código abierto. La arquitectura garantiza que cada token calcule su escritura de memoria a partir de la entrada actual y los parámetros compartidos en lugar de un estado rápido en evolución, permitiendo que las escrituras se compongan mediante un escaneo de prefijo asociativo.

arxiv arXiv cs.CL · hace 17 d SWE-bench Pro · 55.9% · 2 vistas

OpenForgeRL permite el entrenamiento de extremo a extremo de agentes basados en arneses en cualquier entorno

Los investigadores presentan OpenForgeRL, un marco de código abierto que permite el entrenamiento de extremo a extremo de agentes de IA utilizando arneses de inferencia complejos como Claude Code y OpenClaw. El sistema desacopla el entrenamiento de la inferencia mediante un proxy ligero para registrar las llamadas del modelo como datos y un orquestador de Kubernetes para gestionar los despliegues remotos de contenedores.

arxiv arXiv cs.AI · hace 17 d OSWorld · 37.7% · 5 vistas

OpenForgeRL permite el entrenamiento de extremo a extremo de agentes basados en arneses en cualquier entorno

OpenForgeRL es un marco de código abierto que permite a los investigadores entrenar agentes de IA basados en arneses de extremo a extremo utilizando pilas estándar de aprendizaje por refuerzo. Logra esto desacoplando el entrenamiento de la inferencia mediante un proxy ligero que registra las llamadas del modelo como datos y un orquestador de Kubernetes que gestiona el despliegue remoto de contenedores.

media Hugging Face Forums · hace 17 d

ELIZA con autoencoder disperso

Una nueva implementación del chatbot ELIZA utiliza una arquitectura de autoencoder disperso para almacenar entradas de conversación en una capa de memoria latente, con el objetivo de mejorar los métodos tradicionales de coincidencia de palabras clave. El sistema emplea una estructura codificador-decodificador T5 con una capa de memoria de 32,768 neuronas, donde las entradas similares se activan mediante aprendizaje contrastivo.