Una V620 modificada flasheada con firmware W6800 habilita la salida mini-DisplayPort pero desactiva algunos núcleos de cómputo, a pesar de tener relojes de refuerzo más altos. Los benchmarks muestran que Vulkan supera a ROCm en tareas de grupos de tensores (TG), mientras que ROCm es más rápido en el procesamiento de prompts (PP) a profundidades de contexto más largas, con ganancias de rendimiento significativas en configuraciones Q4_K_XL.
Benchmarks de V620 modificada con firmware W6800 en eBay
Notas de la versión de Claude Code v2.1.181
Claude Code v2.1.181 introduce soporte para configurar ajustes mediante sintaxis de prompt como /config thinking=false, añade soporte para eventos Apple en sandbox en macOS y mejora el streaming, el reintento automático y el comportamiento del subagente. También corrige numerosos errores relacionados con el inicio, el manejo de archivos, el portapapeles y la respuesta de la interfaz de usuario en todas las plataformas.
Configuración de implementación Docker SGLang GLM-5.2-FP8 HGX-H200
Un usuario comparte una configuración de Docker para ejecutar GLM-5.2-FP8 en hardware HGX-H200 utilizando SGLang. La configuración logra una longitud de contexto de 262k y 70 tokens por segundo con paralelismo tensorial de 8, usando una fracción de memoria de 0.83. El usuario señala que las recetas oficiales de vLLM no funcionan en H200 debido a limitaciones de cuantización FP8 del caché KV en la arquitectura DSV3.
Flujo de trabajo de ML embebido para dispositivos de borde con microcontroladores
Este artículo describe un flujo de trabajo orientado a sistemas para el aprendizaje automático embebido en dispositivos de clase microcontroladora. Detalla decisiones clave de ingeniería como la muestreo de datos, extracción de características, validación del desbalance de clases, co-diseño modelo-tiempo de ejecución y despliegue en streaming, utilizando el reconocimiento de movimiento inercial y la detección de palabras clave como estudios de caso. El trabajo proporciona reglas prácticas de diseño para una inferencia robusta en dispositivo, incluyendo curación de datos, cuantización, umbralización, programación y monitoreo en campo.
Qxern-v6 utiliza tokens latentes y un sidecar AST para una transferencia de código más rápida y precisa
El sistema Qxern-v6 permite que dos LLM se comuniquen mediante 32 tokens latentes comprimidos mientras preserva la exactitud de los símbolos a través de un sidecar de Abstract Syntax Tree (AST) determinista adaptativo. Desarrollado por un desarrollador de 15 años, la arquitectura utiliza Qwen2.5-Coder-1.5B para comprimir el código y un decodificador congelado Qwen3.5-0.8B para interpretarlo sin ver texto en bruto.
Las pruebas de plugins para agentes de codificación muestran que el ahorro de tokens no equivale a reducciones de costo
Un análisis de tareas de agentes de codificación utilizando GPT-5.6-sol y Codex CLI 0.144.1 demuestra que reducir los tokens de contexto en un 90% no resulta en ahorros proporcionales del costo total de la tarea.