Laguna M.1 es un modelo mixture-of-experts de 225B parámetros con 23B parámetros activados por token, diseñado para codificación agéntica y tareas de largo alcance. Alcanza un rendimiento competitivo en SWE-bench Verified (74.6%), SWE-bench Multilingual (63.1%) y Terminal-Bench 2.0 (45.8%), superando a modelos como Devstral 2 y GLM-4.7 en benchmarks clave.
Laguna M.1: Modelo MoE de 225B parámetros para codificación agéntica
LLMs agénticos de cero disparos extraen patología pulmonar de narrativas
Un flujo de trabajo agéntico de cero disparos que utiliza LLMs de código abierto extrae 13 campos sinópticos del Colegio Estadounidense de Patólogos a partir de informes de patología de resección pulmonar. El mejor modelo (GPT-OSS-20B) logró un Micro-F1 de 0.893, superando la sensibilidad de referencia y capturando con precisión relaciones patológicas complejas sin entrenamiento específico para la tarea.
Flujos de trabajo reutilizables para LLMs locales de larga duración
Hayden ha desarrollado el arnés knot para gestionar tareas de LLM local de larga duración. Permite flujos de trabajo reutilizables con perfiles de agente, monitoreo de eventos del sistema de archivos y activadores automáticos, utilizando Pi.dev como agente predeterminado.
Mejores modelos locales para razonamiento en IA agente
El creador de EverFern pregunta qué modelos locales funcionan mejor para flujos de trabajo agentes y uso del navegador/ordenador. Señala que la inteligencia del modelo rara vez es el cuello de botella, siendo los sistemas de fiabilidad y recuperación más críticos que la elección del modelo.
Sistema de Compañeros: Monitor de entropía en Rust con incertidumbre controlada por NER para inferencia LLM escalonada
El Sistema de Compañeros utiliza un monitor de entropía en Rust para detectar la incertidumbre por token en la inferencia local de Gemma 3 4B, enrutando solo los tokens inciertos a Sonnet mediante extracción de fragmentos controlada por NER y recuperación semántica. Los benchmarks muestran que logra una precisión del 71,4 % a $0,21, superando al patrón Anthropic Advisor (62,9 % a $0,44) en siete conjuntos de datos de Hugging Face, con una mejora clave en SQuAD v2 al enrutar fragmentos del pasaje fuente al modelo en la nube.
IA local para archivos de oficina locales
Un usuario de Reddit pregunta qué agente de IA es mejor para manejar archivos de oficina locales como Excel, PDF, Word y JSON. La publicación busca experiencias de usuarios y flujos de trabajo implementados para este tipo de tareas.