Laboratorio · Cognition
lab Mistral AI News · hace 5 d · 3 vistas

Shieldstral presenta un clasificador de seguridad multimodal de 3B adaptable a políticas

Shieldstral es un clasificador de seguridad multimodal de pesos abiertos de 3B que enmarca la moderación de contenido como una tarea de respuesta a preguntas adaptable a políticas, lo que le permite aceptar políticas en lenguaje natural durante la inferencia sin necesidad de reentrenamiento. Unifica la evaluación de seguridad de texto e imágenes y proporciona puntuaciones de seguridad calibradas en diversos benchmarks mientras se ejecuta de manera eficiente en una única GPU NVIDIA de 16GB.

media r/LocalLLaMA · hace 18 d

Cactus post-entrena Gemma 4 E2B con una sonda para generar puntuaciones de confianza

Cactus ha post-entrenado el modelo Gemma 4 E2B para generar una puntuación de confianza entre 0 y 1 para cada respuesta, permitiendo a los desarrolladores enrutar consultas inciertas hacia modelos en la nube más grandes. El equipo logró esto añadiendo una capa de sonda ligera de 68k parámetros que lee los estados ocultos intermedios durante la decodificación para predecir la probabilidad de un error.

arxiv arXiv cs.LG · hace 25 d

TerraZero: simulador de conducción procedural permite auto-juego a escala sin demostraciones

Los investigadores presentan TerraZero, un simulador de conducción procedural y una pila de entrenamiento por auto-juego diseñada para entrenar agentes robustos de conducción autónoma sin demostraciones humanas. El sistema utiliza un motor C configurable para ejecutar la simulación en la CPU y la inferencia de políticas en la GPU a través de un camino de copia cero, sosteniendo 1,3M pasos de agente por segundo en una única GPU de grado servidor.