Open weights
media TLDR AI · hace 2 h · 10 vistas

Xiaomi abre el código fuente de los modelos MiMo-V2.6 Pro y Flash

Xiaomi ha abierto el código fuente de los modelos omnimodales MiMo-V2.6 Pro y Flash, diseñados para coordinar agentes en la construcción y prueba visual de escenas 3D interactivas. Estos modelos pueden generar activos de Blender, controlar brazos robóticos a partir de transmisiones de cámara, producir frontends y presentaciones, ensamblar videos y componer música como partituras y MIDI.

media MarkTechPost · hace 1 d Terminal-Bench 2 · 69.7% · 9 vistas

AWS Strands Agents lanza el harness de código abierto Strands Harness con menor costo por token

El equipo de AWS Strands Agents ha lanzado Strands Harness, un harness de agentes de propósito general y código abierto disponible bajo la licencia Apache 2.0 para Python y TypeScript. La herramienta está diseñada para cerrar la brecha entre el prototipado de agentes en entornos como Claude Code o Codex y su implementación con bucles personalizados.

lab Microsoft Research Blog · hace 2 d · 29 vistas

Microsoft lanza RetroChimera para la predicción de retrosíntesis

Microsoft Research ha publicado y liberado como código abierto RetroChimera, un nuevo marco de trabajo para la predicción de retrosíntesis que combina dos modelos complementarios para proponer rutas de síntesis de alta calidad. El sistema integra R-SMILES 2, un modelo de-novo basado en Transformer, con NeuralLoc, un modelo basado en redes neuronales gráficas (GNN), utilizando una estrategia de ensamble aprendida para clasificar las predicciones.

lab Hugging Face Blog · hace 2 d · 10 vistas

tokenizers v1 release candidate ofrece codificación 3-30x más rápida mediante división de bitstream y caché

La biblioteca tokenizers ha lanzado una versión candidata a release 1 que mejora significativamente el rendimiento para la codificación de texto, abordando cuellos de botella en los flujos de trabajo de entrenamiento y servicio. La actualización mantiene compatibilidad con la API de v0.23 mientras proporciona aceleraciones sustanciales en diez familias de modelos.

lab Hugging Face Blog · hace 2 d MMLU · 77.0% · 15 vistas

Multiverse reformula la eliminación de bloques LLM como optimización de Ising para compresión profunda

Multiverse ha publicado un artículo que detalla un método que reformula la poda de modelos de lenguaje grandes como un problema de optimización binaria restringida mapeado a un vidrio de Ising. Al tratar los bloques del transformador como espines con acoplamientos por pares derivados de la Hessiana de la pérdida, el enfoque identifica configuraciones óptimas de eliminación de bloques sin requerir evaluación iterativa.

media Interconnects · hace 2 d Artificial Analysis Intelligence Index · 45.0% · 17 vistas

Los modelos chinos de peso abierto superan a sus contrapartes estadounidenses en descargas y benchmarks

El autor presenta un informe sobre el estado de los modelos de peso abierto, señalando que las empresas de IA chinas se han convertido en los claros líderes en este espacio desde aproximadamente abril de 2025. Este cambio queda evidenciado por las métricas de descarga de Hugging Face y el rendimiento en benchmarks de capacidades.

lab Tencent Hunyuan (HF) · hace 6 d · 64 vistas

Tencent lanza WeVisDoc-4B, un analizador de documentos de extremo a extremo

Tencent ha lanzado WeVisDoc-4B, un analizador de documentos de extremo a extremo para imágenes de páginas que convierte las páginas en Markdown estructurado con fórmulas LaTeX y tablas HTML. Fine-tuneado desde Qwen3-VL-4B-Instruct, el modelo alcanza una puntuación general de 95.38 en OmniDocBench v1.6 y se clasifica primero entre los analizadores comparados en las cuatro configuraciones reportadas.

media Together AI Blog · hace 7 d · 16 vistas

Together esboza la estrategia para migrar de modelos propietarios a de código abierto

Together proporciona un marco para que las empresas migren de modelos de IA propietarios a modelos de código abierto (OSM) utilizando servicios gestionados, con el objetivo de reducir la complejidad y acelerar la adopción. El proceso implica descubrir modelos adecuados mediante benchmarks, evaluarlos mediante la repetición del tráfico, adaptar los prompts o los pesos, y calcular el ROI para justificar el cambio.