Todos los artículos — korshunov.ai

Todos los artículos Página 1 / 120

CrossPool: Servicio eficiente de múltiples LLM para modelos MoE en frío mediante la disgregación de KV-Cache y pesos

CrossPool es un motor de servicio diseñado para modelos Mixture-of-Experts (MoE) en frío que disgrega los pesos FFN y el KV-cache en pools separados de memoria GPU para abordar las ineficiencias de memoria en escenarios de solicitudes dispersas. Al consolidar los pesos estáticos y aprovisionar dinámicamente la demanda activa de KV-cache, el sistema tiene como objetivo mejorar la utilización de la memoria GPU y admitir solicitudes de contexto largo con ráfagas.

media r/LocalLLaMA · hace 6 h

El modelo abliterado de HuiHui supera al vanilla 3.6-35B-a3b en matemáticas y código

Una receta de cuantización personalizada aplicada al modelo abliterado de HuiHui demuestra un rendimiento superior en comparación con la variante vanilla 3.6-35B-a3b en tareas de matemáticas y programación. Los resultados sugieren que eliminar los mecanismos de rechazo permite al modelo lograr mayor precisión y sabiduría en estos dominios.

media r/LocalLLaMA · hace 6 h

Amodei: "Los modelos de código abierto se comerán a tus hijos"

Esta publicación de Reddit comparte una imagen que contiene la cita "Los modelos de código abierto se comerán a tus hijos" atribuida a Amodei. El contenido consiste en un enlace a la imagen y un enlace al hilo de comentarios asociado en r/LocalLLaMA.

media r/LocalLLaMA · hace 6 h

Amodei de Anthropic: Los modelos de código abierto podrían ser peligrosos

Dario Amodei, CEO de Anthropic, ha expresado preocupaciones de que los modelos de IA de código abierto puedan llevar a resultados peligrosos. La declaración destaca los riesgos potenciales asociados con el acceso sin restricciones a tecnologías avanzadas de inteligencia artificial.

arxiv arXiv cs.AI · hace 7 h

Sobre la pequeñez de los exponentes de escalado de los modelos de lenguaje grandes

El artículo analiza las razones por las que los exponentes de escalado de las aplicaciones actuales de Modelos de Lenguaje Grande indican un régimen insostenible en cuanto a recursos energéticos.

arxiv arXiv cs.AI · hace 7 h

Una evaluación justa de modelos fundacionales de grafos para la predicción de propiedades de nodos

Este estudio realiza una reevaluación rigurosa de nueve Modelos Fundacionales de Grafos (GFMs) recientes para la predicción de propiedades de nodos, comparándolos con líneas base sólidas de Redes Neuronales de Grafos (GNN) para abordar la falta de estándares de evaluación unificados en el campo.

arxiv arXiv cs.AI · hace 7 h

RaDaR: Un LLM de razonamiento especializado para acelerar el diagnóstico de enfermedades raras

Los investigadores presentan RaDaR, un modelo de lenguaje grande (LLM) de código abierto con 32B parámetros diseñado para acelerar el diagnóstico de enfermedades raras abordando desafíos en la implementabilidad clínica y la escasez de datos. El modelo fue entrenado con casi 50,000 casos públicos y más de 100,000 casos sintéticos, demostrando un rendimiento superior en benchmarks y centros de validación externa.

arxiv arXiv cs.AI · hace 7 h

Aprendizaje por Refuerzo para Agentes de Uso Informático con Evaluación Autónoma

Los autores proponen un marco de ajuste fino basado en aprendizaje por refuerzo que utiliza la evaluación autónoma de visión y lenguaje como una señal de supervisión escalable para agentes de GUI, eliminando la necesidad de etiquetas manuales o heurísticas específicas de la tarea. Al tratar los comentarios del evaluador como un canal de recompensa binario ruidoso y derivar un estimador corregido por ruido para la Optimización de Política Próxima (Proximal Policy Optimization), el método aborda la dificultad de obtener recompensas legibles por máquina en entornos de escritorio de propósito general.

arxiv arXiv cs.AI · hace 7 h

AdversaBench: Red-teaming automatizado de LLM con confirmación de múltiples jueces y transferibilidad entre modelos

Los autores presentan AdversaBench, una pipeline de red-teaming end-to-end que genera entradas difíciles para grandes modelos de lenguaje utilizando cinco operadores de mutación estructurados y confirma fallos mediante un panel de tres jueces con desempate por un meta-juez.

media r/LocalLLaMA · hace 7 h

Samsung, SK Hynix y Micron demandados en EE. UU. por fijación de precios de memoria

Se ha presentado una demanda en Estados Unidos contra los principales fabricantes de chips de memoria Samsung, SK Hynix y Micron por alegaciones de fijación de precios.

blog Simon Willison · hace 7 h

Ornith-1.0: Autoandamiaje de LLMs para Codificación Agéntica

DeepReinforce ha lanzado Ornith-1.0, un modelo de pesos abiertos con licencia MIT que alcanza un rendimiento de vanguardia entre los modelos de código abierto de tamaño comparable en benchmarks de codificación. El modelo se basa en las bases preentrenadas Gemma 4 y Qwen 3.5 e incluye variantes con recuentos de parámetros de 9B Dense, 31B Dense, 35B MoE y 397B MoE.

media r/LocalLLaMA · hace 7 h

Artículo de Arxiv en espera durante 2 meses.

Un investigador que presenta su primer artículo en arXiv informa que el manuscrito ha estado bajo revisión por moderadores durante dos meses a pesar de pasar las verificaciones automáticas de calificación. El autor pregunta si este retraso es normal y solicita consejos sobre si volver a enviar o continuar esperando.

github llama.cpp · hace 7 h

Lanzamiento b9842 de llama.cpp: deduplicación de presets y entradas de modelo en caché en /v1/models

El lanzamiento b9842 de llama.cpp introduce un cambio para deduplicar las entradas de preset y de modelo en caché en el endpoint /v1/models. Esta actualización está firmada por Adrien Gallouët de Hugging Face.

arxiv arXiv cs.AI · hace 8 h

Póster: Explorando los límites de la detección basada en audio de estafas telefónicas turcas

Esta investigación investiga el uso de modelos de lenguaje grandes para detectar llamadas telefónicas fraudulentas en turco, un idioma con pocos recursos donde los datos anotados son escasos. El estudio presenta el primer conjunto de datos multimodal público que contiene 100 pares alineados de audio y transcripción de conversaciones fraudulentas y benignas.

arxiv arXiv cs.AI · hace 8 h

Memoria compartida gobernada para sistemas LLM multi-agente

Este artículo formaliza el problema de la memoria de flota en entornos LLM multi-agente, identificando cuatro modos fundamentales de fallo: fuga no autorizada, propagación obsoleta, persistencia de contradicciones y colapso de procedencia. Para abordar estos problemas, los autores definen primitivas explícitas a nivel del sistema que incluyen recuperación con ámbito, supresión temporal, seguimiento de procedencia y propagación de memoria gobernada por políticas.

arxiv arXiv cs.AI · hace 8 h

Convergencia Cuántica: Uniendo la Inversión en Valor Clásica con los Modelos de Factores Modernos

Esta investigación prueba si las reglas clásicas de inversión en valor de Benjamin Graham pueden actuar como un filtro matemático para evitar que los modelos complejos de aprendizaje automático memoricen el ruido del mercado. El estudio compara las reglas puras de Graham, los factores modernos y una combinación de ambos contra los modelos XGBoost y AutoGluon utilizando 20 años de datos del S&P 500.

arxiv arXiv cs.AI · hace 8 h

Sobrerechazo de pequeños LLM locales en contexto legal penal

Un estudio investiga el impacto del sobrerechazo en modelos de lenguaje grandes pequeños, ejecutados en dispositivo, al procesar prompts legales, encontrando que los prefijos de estilo autoritario aumentan sistemáticamente las tasas de rechazo entre 2 y 20 veces en comparación con una línea base sin prefijo. Si bien los prefijos de jailbreak mediante role-play mostraron efectos mixtos en diferentes modelos, los resultados indican que estos pequeños LLM son inestables bajo encuadres contextuales típicos de usuarios institucionales reales.

arxiv arXiv cs.AI · hace 8 h

ASALT: Alineación adaptativa del estado para transferencia lateral en aprendizaje por refuerzo multiagente

Este artículo presenta ASALT, un método para el aprendizaje de transferencia lateral en el aprendizaje por refuerzo multiagente que se adapta a las dimensionalidades desiguales del espacio de estados entre los dominios de origen y destino. El enfoque utiliza adaptadores a nivel de observación y a nivel de estado para mapear las entradas en un espacio de incrustación compartido, lo que permite una transferencia efectiva del conocimiento entre entornos heterogéneos.

media r/LocalLLaMA · hace 8 h

Valor de GPU dual: paralelismo sobre tamaño del modelo para LLMs locales

El autor argumenta que actualizar de una a dos GPUs ofrece mayores beneficios mediante el procesamiento paralelo en lugar de habilitar el uso de cuantizaciones de modelos más grandes y de mayor calidad. Para tareas de programación, la diferencia de calidad entre las cuantizaciones Q4 y Q6/Q8 es mínima, haciendo que un mayor contexto y throughput sean más valiosos.

media r/LocalLLaMA · hace 8 h

¡Efecto de GLM 5.2 !!

Un usuario de Reddit compartió una imagen titulada "Efecto de GLM 5.2 !!" en el subreddit r/LocalLLaMA.