Laboratorio · Microsoft Research
lab Microsoft Research Blog · hace 6 d SWE-bench Verified · 69.7% · 9 vistas

Microsoft Research lanza el framework Orchard para IA agente escalable

Microsoft Research ha lanzado Orchard, un framework de código abierto diseñado para permitir una investigación escalable y rentable en agentes autónomos. El sistema se centra en Orchard Env, un servicio de entorno basado en Kubernetes que permite a los investigadores entrenar y evaluar agentes en diversos dominios como ingeniería de software, navegación web y asistencia personal sin reconstruir la infraestructura.

lab Microsoft Research Blog · hace 10 d · 3 vistas

Microsoft Research presenta EvoLib para el aprendizaje en tiempo de prueba con una biblioteca en evolución

Microsoft Research ha presentado EvoLib, un marco que permite a los modelos de lenguaje grandes aprender de su propia experiencia durante la inferencia sin necesidad de etiquetas de verdad fundamental ni retroalimentación externa. En lugar de almacenar experiencias crudas como memorias estáticas, EvoLib las transforma en habilidades reutilizables e insights reflexivos que se refinan, consolidan y reponderan continuamente.

lab Microsoft Research Blog · hace 27 d · 1 vista

Microsoft libera código verificado de ML-KEM y SHA-3 en SymCrypt usando Lean y Aeneas

Microsoft ha liberado como código abierto una rama de su biblioteca criptográfica SymCrypt que contiene especificaciones formales y pruebas para las implementaciones de Rust de ML-KEM y SHA-3. Este lanzamiento demuestra una metodología donde los algoritmos de producción se escriben en Rust seguro y se verifican contra modelos Lean derivados de estándares utilizando la cadena de herramientas Aeneas.

media MarkTechPost · hace 4 d

SkillOpt de Microsoft permite la transferencia de habilidades entre Codex y Claude Code

Investigadores de Microsoft, la Universidad Jiao Tong de Shanghái, la Universidad Tongji y la Universidad Fudan desarrollaron SkillOpt, un optimizador en el espacio de texto que entrena documentos de habilidades en lenguaje natural mientras mantiene congelado el modelo objetivo. El sistema utiliza un modelo optimizador para proponer ediciones acotadas basadas en rollouts evaluados, exportando el resultado como un único archivo `best_skill.md`.

media r/LocalLLaMA · hace 12 d · 6 vistas

Microsoft lanza Mage-VL, un modelo multimodal de streaming nativo de códec

Microsoft ha lanzado Mage-VL, un modelo base multimodal eficiente de 4B de parámetros para la comprensión de imágenes y video que utiliza un enfoque nativo de códec para optimizar el procesamiento visual. El sistema separa los flujos de video en fotogramas ancla (I) y predichos (P), conservando solo los parches donde el códec asigna bits para reducir el consumo de tokens visuales en más del 75%.

media r/LocalLLaMA · hace 18 d · 5 vistas

Microsoft lanza Mage-Flow, un modelo nativo de resolución 4B para generación y edición de imágenes

Microsoft ha lanzado Mage-Flow, una pila generativa compacta de escala 4B diseñada para la generación eficiente de texto a imagen y la edición de imágenes basada en instrucciones. El sistema alcanza una calidad competitiva con el estado del arte mediante el co-diseño de un tokenizador ligero, Mage-VAE, y un Transformador de Difusión Multimodal de Resolución Nativa (NR-MMDiT).

arxiv arXiv cs.CL · hace 25 d Codeforces (Elo) · 2048.0Elo · 2 vistas

Microsoft lanza GFlowRL, un RL estable al estilo GFlowNet para modelos de lenguaje grandes

Microsoft presenta GFlowRL, un algoritmo de aprendizaje por refuerzo simplificado que escala las Generative Flow Networks a modelos de lenguaje grandes eliminando la red auxiliar de partición. El método reemplaza la función de partición condicional aprendida con una estimación Monte Carlo en lote y añade corrección de muestreo por importancia y recorte asimétrico del salto de flujo para estabilidad.

arxiv arXiv cs.LG · hace 26 d

REGRIND aprende manipulación diestra a partir de una única demostración humana

Los autores presentan REGRIND, una canalización de aprendizaje por refuerzo guiada por retargeting que es minimalista y aprende políticas de manipulación diestra a partir de una única demostración humana. El método reorienta el movimiento humano del objeto al robot preservando las relaciones espaciales y de contacto, luego entrena una política residual de RL en simulación para rastrear puntos clave centrados en el objeto.

arxiv arXiv cs.CL · hace 26 d

Estudio de caso en bengalí integra SLMs con NLP culturalmente sensible para la detección de desinformación sobre salud

Esta investigación propone un detector basado en IA para la desinformación sobre la salud, amigable con la diversidad cultural y lingüística (CALD), abordando específicamente la falta de herramientas efectivas para idiomas de bajos recursos como el bengalí. Los autores evalúan Small Language Models (SLMs) para superar las limitaciones de Large Language Models en este contexto.