Todos los artículos — korshunov.ai

Todos los artículos Página 1 / 99

GLM-5.2 surge como modelo de código líder de pesos abiertos

GLM-5.2 es ampliamente considerado el primer modelo de código de pesos abiertos que rivaliza con modelos de vanguardia como Opus 4.8 y GPT-5.5 en capacidad. Los profesionales destacan su fuerte uso de herramientas, planificación a largo plazo y comportamiento autónomo de subagentes, con consenso de que ahora opera de manera creíble en el rango de SWE de vanguardia. La aparición del modelo subraya el creciente valor de los pesos abiertos para la competencia entre proveedores, despliegue on-prem y reducción del bloqueo de proveedor.

lab NVIDIA Technical Blog · hace 2 h

Construye tu propio modelo de base de transacciones para inteligencia financiera

Los datos de transiciones capturan patrones ricos del comportamiento humano y son un activo clave para las empresas. Los casos de uso actuales a menudo dependen de características frágiles e ingenierizadas manualmente que no logran capturar el comportamiento secuencial del cliente en los historiales de transacciones.

lab NVIDIA Technical Blog · hace 2 h

NVIDIA lanza XR AI para gafas de realidad aumentada y dispositivos portátiles

NVIDIA presenta XR AI para cerrar la brecha de infraestructura para desarrolladores que crean experiencias de IA en gafas de RA y dispositivos de RA. La solución permite la integración de flujos de sensores en vivo, modelos de IA multimodales y datos empresariales dentro de entornos de ejecución específicos del dispositivo, agilizando el desarrollo de agentes de IA para dispositivos portátiles.

media Latent Space · hace 2 h

Suscriptores de Latent Space obtienen un descuento de $250 para AIE WF 2026

Los suscriptores de Latent Space reciben un descuento por tiempo limitado de $250 en las entradas para AIE WF 2026. Los asistentes también reciben $40k en créditos de patrocinadores de empresas como Warp, Datadog, SourceGraph, Stripe y Fireworks.

media Latent Space · hace 2 h

GLM-5.2 supera la prueba de vibes y supera a GPT-5.5

GLM-5.2 ha superado una 'prueba de vibes' como modelo abierto de vanguardia, recibiendo elogios de Jeremy Howard y superando a GPT-5.5 en el nuevo benchmark de trabajo de conocimiento de Artificial Analysis. También obtuvo la validación de la comunidad /r/LocalLlama, lo que indica una utilidad y rendimiento sólidos en el mundo real.

arxiv arXiv cs.AI · hace 2 h

UFP4: El entrenamiento uniforme de 4 bits supera el sesgo de contracción en el preentrenamiento de LLM

Un estudio identifica un sesgo de contracción en los formatos FP4 basados en E2M1 debido a la asimetría geométrica, lo que provoca acumulación de errores multiplicativos e inestabilidad en el entrenamiento. La receta UFP4 propuesta utiliza cuadrículas uniformes E1M2/INT4 y aplica la Transformada de Hadamard Aleatoria a todos los GEMM, logrando una degradación menor de la pérdida que las líneas base E2M1 en el preentrenamiento de LLM a gran escala. Los autores recomiendan E1M2/INT4 como un primitivo de entrenamiento de primera clase para futuros aceleradores.

arxiv arXiv cs.AI · hace 2 h

DataMagic convierte datos tabulares en videos interactivos de insights

DataMagic transforma datos tabulares crudos y consultas en lenguaje natural en videos narrativos de insights de datos. Utiliza DVSpec para garantizar la fidelidad de los datos vinculando elementos visuales a campos de datos mediante referencias semánticas, y emplea una arquitectura multiagente para generar y orquestar escenas de video coherentes. El sistema admite exploración interactiva y preguntas-respuestas basadas en procedencia de datos, permitiendo a los usuarios interactuar con los datos más allá de vistas estáticas.

arxiv arXiv cs.AI · hace 2 h

NRT-Bench: Red-teaming multi-turn de agentes LLM en sistemas críticos para la seguridad

NRT-Bench presenta un benchmark para el red-teaming multi-turn de agentes LLM que operan en una planta de energía nuclear simulada. En cuatro modelos de operador de vanguardia, entre el 8,7 % y el 12,1 % de las sesiones de ataque provocan la pérdida de una función crítica de seguridad, con vulnerabilidades en gran medida disjuntas entre los modelos. La efectividad de las defensas varía significativamente según el modelo, mostrando una fuerte dependencia del modelo.

arxiv arXiv cs.AI · hace 2 h

La descompilación multi-vista mejora la clasificación de malware basada en LLM

Un benchmark de binarios benignos y maliciosos compilados y descompilados con Ghidra y RetDec revela que proporcionar ambas vistas del descompilador a los modelos de lenguaje grandes mejora el F1 de la clase maliciosa, principalmente al aumentar la recall. El análisis muestra que Ghidra y RetDec cometen errores distintos, lo que indica que sus salidas ofrecen evidencia complementaria para la clasificación de malware.

arxiv arXiv cs.AI · hace 2 h

Aprendizaje profundo guiado por atención para la clasificación interpretable de morfología espermática

Un nuevo marco de aprendizaje profundo combina EfficientNet-B0 con CBAM para mejorar la precisión y la interpretabilidad en la clasificación de morfología espermática. Evaluado en los conjuntos de datos SMIDS y HuSHem, alcanza una precisión del 90,2 % y del 93,9 % con puntuaciones F1 macro de 0,913 y 0,948, superando a los modelos base. Las visualizaciones Grad-CAM++ permiten un análisis transparente de las características, apoyando la adopción clínica en clínicas de fertilidad.

arxiv arXiv cs.AI · hace 2 h

Calibración sin comprensión en la detección de vulnerabilidades de LLM

CWE-Trace evalúa ocho LLMs base y 15 LLMs ajustados con LoRA en la detección de vulnerabilidades del kernel de Linux. Los resultados muestran que la contaminación de los datos no ofrece ninguna ventaja, y el ajuste fino solo desplaza los umbrales de salida sin alterar las políticas de decisión. A pesar de las puntuaciones de detección mejoradas, los LLMs carecen de razonamiento de seguridad confiable, con una precisión de CWE top-1 inferior al 1.3% y un rendimiento de detección binaria del 52.1%.

arxiv arXiv cs.AI · hace 2 h

FreeStyle: Generación escalable de referencias duales de estilo y contenido mediante minería de LoRA comunitario

FreeStyle propone un marco que mina LoRAs comunitarios para generar tripletes de imágenes de referencia dual de estilo-contenido a gran escala. Emplea un currículo en dos etapas con mecanismos de desentrelazamiento para suprimir la fuga de estilo e introduce una evaluación con puntuaciones invariantes al estilo y basadas en VLM para evaluar la preservación del contenido y el rechazo de fugas.

arxiv arXiv cs.LG · hace 2 h

SSH-Net: Red neuronal profunda para la predicción del tiempo de fallo bajo riesgos competitivos

SSH-Net es una red neuronal profunda estructurada diseñada para predecir funciones de distribución del tiempo de fallo bajo riesgos competitivos. Utiliza subredes separadas para diferentes grupos de covariables, mejorando la precisión al alinear la estructura neuronal con la jerarquía de los datos. El modelo se valida mediante estudios de simulación y se aplica a datos de fallo de GPUs Titan.

arxiv arXiv cs.LG · hace 2 h

Percolación crítica como modelo de datos sintéticos para interpretabilidad

Un nuevo conjunto de datos sintético basado en clústeres de percolación de campo medio crítico proporciona un modelo realista y analíticamente manejable con estructura jerárquica. Presenta clústeres dispersos y fractales con distribuciones de tamaño de ley de potencias y variables latentes que generan valores objetivo a través de una jerarquía taxonómica. Las redes neuronales pueden decodificar linealmente estas variables latentes verdaderas desde las activaciones, demostrando una fuerte interpretabilidad.

arxiv arXiv cs.AI · hace 2 h

Cómo los LLM alineados con la seguridad interpretan demostraciones mixtas de cumplimiento

Los estudios muestran que las demostraciones benignas y dañinas de cumplimiento no son intercambiables en los LLM. Las demostraciones benignas pueden reducir o aumentar el cumplimiento dañino dependiendo del modelo, con la optimización de preferencias desempeñando un papel clave para prevenir el cumplimiento dañino. El orden de las demostraciones muestra un fuerte sesgo de recencia, y los modelos varían en cómo manejan el rechazo durante el aprendizaje in-context.

arxiv arXiv cs.AI · hace 2 h

Verificación probabilística eficiente y válida para agentes de IA

Un nuevo marco permite la aplicación segura y probabilística de políticas para agentes de IA en entornos ambiguos. Utiliza optimización robusta distribucional para calcular límites superiores rigurosos sobre las probabilidades de violación de políticas sin asumir independencia de predicados. El método supera a los enfoques anteriores en benchmarks de agentes con terminales y llamadas a herramientas, mejorando el equilibrio entre seguridad y utilidad.

arxiv arXiv cs.AI · hace 2 h

Multi-LCB: Extender LiveCodeBench a 12 lenguajes de programación

Multi-LCB extiende LiveCodeBench a doce lenguajes de programación, preservando sus controles de contaminación y protocolo de evaluación. Revela sobreajuste en Python, sesgos específicos del lenguaje y brechas significativas de rendimiento entre LLMs a través de los lenguajes, estableciendo un riguroso benchmark para la generación de código multilingüe.

arxiv arXiv cs.AI · hace 2 h

FlowEdit: Adaptación de pronunciación continua en TTS con emparejamiento de flujos

FlowEdit permite que los modelos TFS de emparejamiento de flujos congelados adapten correcciones de pronunciación a lo largo del tiempo mediante ediciones latentes en incrustaciones de texto. Almacena las correcciones en una Red de Hopfield moderna y las recupera mediante atención suave con compuerta de similitud, reduciendo las tasas de error de fonema en un 92.7% en 312 sustantivos propios multilingües mientras preserva la calidad del habla general. Las correcciones tardan aproximadamente 15 segundos en completarse en una sola GPU.

arxiv arXiv cs.AI · hace 2 h

Corredor de Ejecución Soberana para Control Agéntico Vinculado a Certificados

El Corredor de Ejecución Soberana (SEB) introduce un límite de aplicación en tiempo de ejecución que verifica y ejecuta la autoridad certificada en sistemas agénticos. Valida contratos de ejecución, verifica los períodos de validez y asegura el cumplimiento de políticas antes de invocar las APIs de infraestructura, proporcionando una capacidad de ejecución efímera, auditable y revocable. El prototipo fue evaluado en AWS y Kubernetes, midiendo la latencia, la propagación de revocaciones y la resistencia a inyección de fallos.

arxiv arXiv cs.AI · hace 2 h

SARLO-80: Se lanza el conjunto de datos VHR SAR-Óptico-Texto

SARLO-80 es un conjunto de datos a gran escala que combina SAR SLC de muy alta resolución, imágenes ópticas alineadas y descripciones en lenguaje natural. Incluye 119,566 tripletes de 2,500 escenas globales en 72 países, estandarizados a una cuadrícula de rango de deslizamiento de 80 cm con alineación a nivel de píxel y tres variantes de leyenda. El conjunto de datos está disponible públicamente en Hugging Face para benchmarks de aprendizaje multimodal en la geometría nativa de SAR.