Un estudio introduce métricas ligeras e interpretables que afilan el límite entre errores clínicamente significativos y variaciones inofensivas en los informes de radiología. Estas métricas superan a los grandes LLM médicos y compiten con modelos propietarios, habiéndose demostrado que el entrenamiento de un solo paso es eficaz para despliegues sensibles al costo. El ajuste de dos pasos no mejora consistentemente el rendimiento y desvía el enfoque de la detección de errores hacia la robustez.
Las métricas basadas en LLM mejoran la evaluación de la significancia clínica en radiología
CRAX: Benchmarking rápido y seguro de aprendizaje por refuerzo
CRAX introduce un benchmark de seguridad acelerado y de alta fidelidad para el aprendizaje por refuerzo utilizando MuJoCo XLA. Logra aceleraciones de hasta 100x sobre benchmarks basados en CPU mediante vectorización y aceleración por hardware, presentando seis conjuntos de entornos y tres tareas específicas del agente en tres niveles de dificultad. La evaluación de seis métodos de RL seguro muestra que ningún enfoque domina, destacando los compromisos entre rendimiento y seguridad, con el aprendizaje por currículo y la transferencia de seguridad mejorando los resultados.
CRAX: Benchmarking rápido y seguro de aprendizaje por refuerzo
CRAX introduce un benchmark de seguridad de alta fidelidad y rápido para el aprendizaje por refuerzo utilizando MuJoCo XLA. Logra aceleraciones de hasta 100x sobre benchmarks basados en CPU mediante vectorización y aceleración de hardware, presentando seis conjuntos de entornos y tres tareas específicas del agente en tres niveles de dificultad. La evaluación de seis métodos de RL seguro muestra que ningún enfoque domina, destacando los compromisos entre rendimiento y seguridad, con el aprendizaje por currículo y la transferencia de seguridad mejorando los resultados.
La IA de voz en tiempo real oye pero no escucha
Un estudio evalúa cuatro sistemas principales de voz en tiempo real para producción: GPT Realtime 2 de OpenAI, Gemini 3.1 Flash Live de Google, y Qwen3.5 Omni Plus y Omni Flash de Alibaba. La investigación se centra en tareas donde tanto las palabras como la entonación vocal transmiten información significativa en tres escenarios consecuentes. Los cuatro sistemas actúan sobre las palabras literales en lugar de la voz, lo que lleva a errores como colgar llamadas con usuarios que lloran e insisten en que no hay problema o aprobar transferencias bancarias realizadas con voces asustadas. Sorprendentemente, esta desconexión a menudo no es un fallo de percepción, ya que tres de los cuatro sistemas pueden identificar confiablemente angustia, miedo o sarcasmo cuando se les pregunta directamente. A pesar de esta conciencia, los modelos ignoran estas señales emocionales durante la toma de decisiones, exhibiendo lo que los autores denominan la 'brecha de inteligencia emocional'. El estudio también señala que los sistemas estiman el acento y la edad basándose en sesgos léxicos en lugar de propiedades acústicas. Inducir a los sistemas a prestar atención explícita a la entrega vocal mejora el rendimiento solo parcialmente e inconsistentemente. Estos hallazgos sugieren que la IA de voz en tiempo real actual se comporta como si el habla se redujera a una transcripción, lo que exige precaución en entornos donde el tono es crítico.
MACR: Resolución explícita de conflictos para inferencia de LLM
MACR introduce un marco de razonamiento multiagente para resolver conflictos de conocimiento en la inferencia de LLM evaluando conjuntamente el conocimiento interno y externo. Utiliza entropía semántica para medir la confianza y emplea tres agentes especializados para inducir reglas, detectar conflictos y resolver inconsistencias entre contextos. Los resultados empíricos muestran que MACR supera a los métodos más avanzados y proporciona resoluciones de conflictos interpretables.
Protocolo VLM-as-3D-Judge de-biased para Generación de Muebles
Un protocolo de juez basado en VLM de-biased especializa TRELLIS en la generación de muebles mediante adaptación ligera. El protocolo aborda modos de fallo como sobrecarga de imagen y ocultamiento de geometría, con calibración que muestra tasas de victoria de 0.83–1.0 y simetría base-vs-base en 0.5. Entre seis métodos de adaptación, la reparación del condicionador bajo degradación severa alcanza paridad con el modelo base, mientras que ningún método supera el objetivo de tasa de victoria del 65%.