Un usuario de Reddit pregunta sobre el rendimiento en el mundo real de VibeThinker-3B más allá de las puntuaciones de benchmark, centrándose en la depuración, programación, razonamiento, latencia y usabilidad. El modelo está disponible en Hugging Face y se describe en un artículo en arXiv.
¿Alguien ha usado VibeThinker-3B fuera de los benchmarks?
GLM 5.2 solo con CPU: Epyc y 512GB de RAM
Un usuario probó la versión de 4 bits de GLM-5.2 (GLM-5.2-UD-Q4_K_XL) en un servidor equipado con un procesador Epyc Rome 7452 y 512GB de RAM. El modelo fue evaluado utilizando un prompt de codificación complejo que requería la creación de un juego de arena 3D autocontenido en HTML, CSS y JavaScript.
Marco de trabajo de texto a CAD inspirado en TRIZ mejora el diseño creativo
Un marco de trabajo de texto a CAD inspirado en TRIZ utiliza modelos de lenguaje grandes para generar modelos CAD 3D creativos y editables integrando principios inventivos de datos de patentes. En un estudio de caso sobre diseño de sillas, logró una reducción de masa del 4.0-14.7% mientras preservaba la integridad estructural mediante principios como la segmentación y los materiales compuestos.
llama-server se bloquea con el aviso 'pegado como archivo' para la extracción de datos de imagen
llama-server se bloquea cuando un usuario pega un aviso largo como un archivo de texto junto con una imagen, tratándolo como un archivo adjunto. El servidor funciona correctamente cuando el aviso se envía en lotes más pequeños, pero falla cuando todo el aviso se combina en un solo bloque de texto y se envía junto con la imagen.
Marco Match Task to Objective para Modelos Encoder-Decoder
Este estudio presenta el marco Match Task to Objective (MTO) para alinear los objetivos de preentrenamiento y ajuste fino con tareas específicas. El marco permite la adaptación automática y no supervisada de datos y logra mejoras de rendimiento superiores al 120% en configuraciones de few-shot, superando a las líneas base tanto en escenarios de few-shot como de conjunto completo de datos. También mejora el prompt-tuning proporcionando orientación efectiva para la ingeniería de soft prompts.
Control bayesiano para agentes de codificación
El control bayesiano mejora las decisiones de uso de herramientas en agentes de codificación modelando la incertidumbre y eligiendo dinámicamente acciones. Supera a los orquestadores de reglas fijas, especialmente cuando la verificación es costosa y los críticos proporcionan retroalimentación informativa pero imperfecta. El método también produce una puntuación de corrección más interpretable que las métricas de probabilidad de tokens o el éxito bruto de herramientas.