Tmax presenta la mejor receta RL de código abierto para agentes terminales, alcanzando un 27% en Terminal-Bench 2.0 con solo 9B parámetros. Utiliza una taxonomía de datos novedosa para generar más de 2.5x entornos terminales que los conjuntos de datos anteriores, permitiendo un entrenamiento eficiente con una receta sencilla basada únicamente en el resultado. El conjunto de datos, los modelos y el código se han publicado como código abierto en https://github.com/hamishivi/tmax.
Tmax: Una receta RL sencilla para agentes terminales
Benchmarks
| Benchmark | Modelo | Puntuación |
|---|---|---|
| Terminal-Bench 2 | Tmax | 27% |
HealthClaw: agente de código abierto con memoria autoevolutiva para la gestión longitudinal de la salud personal
Los investigadores desarrollaron HealthClaw, una arquitectura de agente de código abierto diseñada para actualizar el soporte a medida que cambian las rutinas, preferencias, mediciones y riesgos de una persona con el tiempo. Separa las reglas de seguridad compartidas y el conocimiento médico de la memoria longitudinal privada que contiene hechos del perfil, procedimientos reutilizables y rastros episódicos.
DiaLLM investiga la brecha entre robustez y generación en la adaptación a dialectos del inglés
El estudio DiaLLM aborda la desconexión entre comprender y producir inglés dialectal mediante el preentrenamiento continuo de tres familias de modelos de lenguaje de peso abierto en el Corpus Internacional del Inglés. Aplica paradigmas de postentrenamiento implícitos y explícitos combinados con tres estrategias de alineación para comparar el inglés australiano, indio y británico septentrional.
DiaLLM investiga la brecha entre robustez y generación en la adaptación a dialectos del inglés
El estudio de DiaLLM revela que la robustez dialectal y la generación están disociadas en los modelos de lenguaje grandes, ya que las evaluaciones formadas por preentrenamiento continuo no capturan cómo el alineamiento moldea la salida real. Los autores realizan un preentrenamiento continuo de tres familias de modelos de peso abierto en el Corpus Internacional del Inglés y aplican paradigmas de postentrenamiento implícitos y explícitos combinados con tres estrategias de alineamiento para el inglés australiano, indio y británico del norte.
BERTomelo: Tu mejor amigo codificador en portugués
Este artículo presenta BERTomelo, un codificador monolingüe de próxima generación específicamente optimizado para el idioma portugués utilizando la arquitectura ModernBERT.
AOHP: Un arnés de agente a nivel del sistema operativo de código abierto para interacciones personalizadas, eficientes y seguras
El Proyecto Android Open Harness (AOHP) es un arnés de agente a nivel del sistema operativo de código abierto construido sobre el Proyecto de Código Abierto de Android. Aborda la discrepancia entre los sistemas operativos actuales centrados en aplicaciones y las necesidades de los agentes de IA autónomos, tratando a los agentes como actores de primer nivel del SO. El diseño introduce tres mecanismos clave: composición de servicios personalizados, interfaces eficientes para agentes y flujo seguro de información. Estas características permiten interfaces de usuario adaptables y entornos de ejecución amigables para agentes, preservando al mismo tiempo el ecosistema existente de Android. Los experimentos preliminares en tareas desafiantes demuestran mejoras significativas en el rendimiento en comparación con los sistemas convencionales. Específicamente, AOHP logró un aumento del 21.12% en las tasas de finalización de tareas en comparación con los métodos base. También redujo los costos de ejecución de tokens en un 51.55%, destacando sus ganancias de eficiencia. Además, el sistema mostró una mejor cumplimiento de las políticas de seguridad durante las interacciones mediadas por agentes.