Todos los artículos
media Interconnects · hace 14 d

Revisión de la receta de post-entrenamiento de Frontier con Finbarr Timbers

El podcast analiza la evolución de las recetas de post-entrenamiento en modelos de lenguaje grandes, desde InstructGPT hasta los modelos frontier de 2026. Destaca la Distilación On-Policy Multi-Maestro (MOPD) como el patrón dominante, donde los modelos especialistas por dominio se entrenan y luego se destilan en un modelo estudiante general mediante distilación on-policy, escalando a más de 10 maestros en modelos como DeepSeek V4 y Nemotron 3 Ultra.

media r/LocalLLaMA · hace 14 d

Por qué DiffusionGemma podría destacar en llamadas a herramientas a pesar de una calidad base inferior

DiffusionGemma utiliza atención bidireccional para permitir la autocorrección durante la generación de tokens, lo que le permite revisar los tokens anteriores en un bloque de 256 tokens. Esta capacidad le otorga una ventaja estructural al generar llamadas a herramientas válidas, ya que puede corregir salidas malformadas que los modelos autoregresivos no pueden corregir una vez comprometidos.

media r/LocalLLaMA · hace 14 d

Resultados de la prueba de rendimiento de cuantización de Qwen3.6 27B

Una prueba que compara las versiones cuantizadas Q8 e IQ3 XXS turbo4 de Qwen3.6 27B muestra que Q8 destaca en seguridad de API y sanitización de entradas, mientras que IQ3 XXS turbo4 tiene un mejor desempeño en gestión de hilos y diseño de código modular. El modelo recomienda combinar ambos enfoques: usar Q8 para la protección inicial al inicio e IQ3 XXS para escrituras atómicas y ciclo de vida de los hilos, formando una base combinada de Fase 1.

media r/LocalLLaMA · hace 14 d

Instrucciones de endurecimiento del razonamiento para Gemma 12b

Se ha desarrollado una instrucción de sistema para reducir el sesgo cognitivo en el razonamiento de Gemma 12b, al exigir un estricto apego a las premisas y la intención explícita del usuario. La instrucción desaconseja recurrir por defecto a interpretaciones 'habituales', 'estándar' o 'típicas', y obliga a reexaminar cualquier suposición de este tipo, mejorando el rendimiento en preguntas trampa sin sobreanalizar las normales.

media r/LocalLLaMA · hace 14 d

Desconfía de las distilaciones de Qwen/Claude: a menudo son peores que el modelo base

Las distilaciones de modelos Qwen y Claude, como Qwen 3.6 distilado con solo 4.000 muestras, rara vez mejoran el rendimiento y a menudo degradan la calidad. Estos modelos pueden exhibir un estilo más 'similar a Opus', pero fallan al transferir capacidad real, con algunos mostrando alucinaciones y tiempos de respuesta más lentos en comparación con los modelos base, según lo demostrado en pruebas y reportes de usuarios.

media r/LocalLLaMA · hace 15 d

AeroLLM: aplicación de IA rápida y de código abierto para Apple Silicon

AeroLLM es una aplicación de chat rápida, optimizada y de código abierto diseñada para dispositivos con Apple Silicon que utiliza el backend MLX. Admite tareas de IA locales como texto a voz, voz a texto y modelos de lenguaje grandes, con modelos descargados directamente desde Hugging Face según la RAM disponible. La aplicación está notariada debido a la falta de membresía en Apple Developer, pero los usuarios pueden seguir los pasos proporcionados para ejecutarla como una app firmada en macOS.