llama-server se bloquea cuando un usuario pega un aviso largo como un archivo de texto junto con una imagen, tratándolo como un archivo adjunto. El servidor funciona correctamente cuando el aviso se envía en lotes más pequeños, pero falla cuando todo el aviso se combina en un solo bloque de texto y se envía junto con la imagen.
llama-server se bloquea con el aviso 'pegado como archivo' para la extracción de datos de imagen
GLM 5.2 solo con CPU: Epyc y 512GB de RAM
Un usuario probó la versión de 4 bits de GLM-5.2 (GLM-5.2-UD-Q4_K_XL) en un servidor equipado con un procesador Epyc Rome 7452 y 512GB de RAM. El modelo fue evaluado utilizando un prompt de codificación complejo que requería la creación de un juego de arena 3D autocontenido en HTML, CSS y JavaScript.
Marco de trabajo de texto a CAD inspirado en TRIZ mejora el diseño creativo
Un marco de trabajo de texto a CAD inspirado en TRIZ utiliza modelos de lenguaje grandes para generar modelos CAD 3D creativos y editables integrando principios inventivos de datos de patentes. En un estudio de caso sobre diseño de sillas, logró una reducción de masa del 4.0-14.7% mientras preservaba la integridad estructural mediante principios como la segmentación y los materiales compuestos.
Marco Match Task to Objective para Modelos Encoder-Decoder
Este estudio presenta el marco Match Task to Objective (MTO) para alinear los objetivos de preentrenamiento y ajuste fino con tareas específicas. El marco permite la adaptación automática y no supervisada de datos y logra mejoras de rendimiento superiores al 120% en configuraciones de few-shot, superando a las líneas base tanto en escenarios de few-shot como de conjunto completo de datos. También mejora el prompt-tuning proporcionando orientación efectiva para la ingeniería de soft prompts.
Control bayesiano para agentes de codificación
El control bayesiano mejora las decisiones de uso de herramientas en agentes de codificación modelando la incertidumbre y eligiendo dinámicamente acciones. Supera a los orquestadores de reglas fijas, especialmente cuando la verificación es costosa y los críticos proporcionan retroalimentación informativa pero imperfecta. El método también produce una puntuación de corrección más interpretable que las métricas de probabilidad de tokens o el éxito bruto de herramientas.
LLMs evaluados para la detección de vulnerabilidades web
Un estudio evalúa seis LLMs en la detección de vulnerabilidades web del mundo real en plugins de WordPress, encontrando que las tasas de detección varían según el modelo y el diseño del prompt. Claude Opus 4.6 logró la tasa de detección más alta con un 63%, mientras que Qwen 3.5 solo alcanzó un 35%, y ningún modelo identificó consistentemente todas las vulnerabilidades de referencia a través de las iteraciones.