Tmax-27B es un agente terminal basado en Qwen3.6-27B, entrenado con DPPO (RL), logrando 43% en Terminal Bench 2.0 y 69% en TB Lite. Para ejecutarse en GPUs de consumo, se cuantiza utilizando modelos GGUF calibrados por matriz de importancia desde 2 hasta 5 bits por peso, con una cabeza MTP injertada que permite descodificación especulativa. IQ2_XS a 8.5 GiB alcanza una tasa de éxito del 70% en tareas de codificación agéntica, superando la cuantización simple y demostrando generación estable de llamadas a herramientas.
Tmax-27B Agente Terminal para GPUs Pequeñas con Entrenamiento DPPO
Benchmarks
| Benchmark | Modelo | Puntuación |
|---|---|---|
| Terminal-Bench 2 | Tmax-27B | 43% |
Claude Code v2.1.267 añade maxEffortLevel y corrige la estabilidad del caché de prompts
La versión 2.1.267 de Claude Code introduce un nuevo ajuste `maxEffortLevel` para limitar el esfuerzo en todos los proveedores, junto con correcciones significativas para la estabilidad del caché de prompts y la reanudación de sesiones. La actualización también aborda varios errores en la integración de VS Code, Claude Tag y la programación en la nube.
Mistral ayuda a un operador energético europeo a migrar 40.000 líneas de Fortran 77 a C++
Mistral asistió a un operador energético europeo en la migración de 40.000 líneas de código legado de Fortran 77 para un simulador de reservorios intensivo en física hacia C++ moderno. El proyecto abordó los desafíos de traducir código procedural con estado global a una arquitectura orientada a objetos, garantizando al mismo tiempo la paridad numérica.
OpenAI Agents Python v0.22.2 añade soporte para generación de imágenes y corrige carreras de enlaces simbólicos
OpenAI lanzó la versión 0.22.2 del SDK openai-agents-python, introduciendo nuevas capacidades para la generación de imágenes y abordando problemas de estabilidad en el manejo de sandbox y sesiones.
ZYR presenta ZYR3.1 con control ATP, red de agentes ACN y contexto de 1M
ZYR ha presentado ZYR3.1, un sistema de IA diseñado para ejecutar tareas complejas en lugar de simplemente responder a prompts. La arquitectura se centra en ATP como centro de control principal y ACN como la Red de Comunicación de Agentes.
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
ExecCritic introduce un marco que separa la construcción de pruebas de la reparación del código fuente para evitar una confianza falsa en los agentes de codificación. El sistema emplea un agente de prueba y un agente de reparación, ambos respaldados por Qwen-3.5-35B-A3B, entrenados por separado mediante aprendizaje por refuerzo.