Todos los artículos
media r/LocalLLaMA · hace 12 d

Solución al descenso abrupto de decodificación de contexto largo en Radeon R9700 con vLLM 0.22.1

Un descenso abrupto en el rendimiento de decodificación de contexto largo en AMD Radeon AI PRO R9700 (RDNA4) fue resuelto habilitando AITER Unified Attention en vLLM 0.22.1. La corrección implica relajar un gate CDNA para incluir RDNA4, deshabilitar otros backends de atención y usar caché KV bf16, lo que resulta en aceleraciones significativas en todas las longitudes de contexto. FP8 KV es ineficaz en este hardware, y el contexto nativo del modelo de 262K se logra completamente con bf16, ofreciendo ~2.9× concurrencia sin necesidad de FP8.

media r/LocalLLaMA · hace 12 d

La Comisión selecciona al consorcio EUROPA como ganador del Gran Desafío de IA de Frontera

La Comisión Europea ha elegido al consorcio EUROPA, liderado por Domyn, para desarrollar un modelo de IA de frontera de código abierto en los 24 idiomas de la UE. El proyecto, lanzado en febrero de 2026, tiene como objetivo crear un modelo con más de 400 mil millones de parámetros, demostrando la capacidad de Europa para construir IA avanzada con su propia infraestructura.

media r/LocalLLaMA · hace 12 d

La economía de la IA está comenzando a favorecer a los modelos abiertos

Los recientes lanzamientos de modelos de IA muestran que los modelos de alta inteligencia y bajo costo están cada vez más dominados por modelos de peso abierto como DeepSeek, Qwen, GLM, Kimi y MiniMax. Para la mayoría de las aplicaciones del mundo real, la brecha de rendimiento entre los modelos cerrados de vanguardia y los fuertes modelos abiertos se está reduciendo más rápido que las diferencias de costo, haciendo que los modelos abiertos sean competitivos en términos de capacidad y precio.

media r/LocalLLaMA · hace 12 d

Añadir una segunda GPU a la placa base X670E para LLMs locales

Un usuario quiere añadir una segunda GPU de 16 GB de VRAM (5060 Ti o 5070 Ti) a su placa base MSI X670E Tomahawk WiFi para ejecutar grandes LLMs locales como Qwen 3.6 27B. La configuración actual carece de espacio para una segunda GPU debido a que la 5070 Ti principal ocupa la segunda ranura PCIe, dejando solo la tercera ranura parcialmente disponible. El usuario busca consejos sobre opciones viables, como usar la cuarta ranura PCIe o un adaptador (riser), considerando refrigeración, estabilidad y ajuste físico, especialmente con un montaje horizontal de GPU como el Lian Li VG4v4.

media Interconnects · hace 12 d

Prohibir la IA de código abierto sería un error

El artículo argumenta que prohibir la IA de código abierto sería un grave error, ya que es segura, protege la seguridad y impulsa la innovación, la educación y la competencia. El código abierto ha impulsado durante mucho tiempo el progreso tecnológico y sirve como un contrapeso vital frente a los modelos de IA monopolísticos, garantizando un acceso más amplio y una innovación democrática sin comprometer la seguridad ni la protección.