Un nuevo método evalúa la consistencia física en los videos generados sin requerir votación humana ni referencias de verdad fundamental. Utiliza DROID-SLAM y SEA-RAFT para detectar inconsistencias, mejorando las tasas de éxito de la tarea en más del 8% y permitiendo la localización espaciotemporal de artefactos físicos.
Evaluación libre de referencias de la consistencia física en la generación de video
Prueba de la consistencia del personaje de Seedance 2.5 en múltiples looks de moda
Un usuario probó el modelo de generación de video Seedance 2.5 utilizando una secuencia corta de moda y editorial que presentaba un solo personaje con diferentes atuendos, composiciones y estilos visuales.
CineCap: Razonamiento estructurado con anclajes espaciotemporales para la descripción de videos cinematográficos
Los investigadores proponen CineCap, un marco que combina razonamiento estructurado con anclajes espaciotemporales y aprendizaje por refuerzo para mejorar la descripción de videos cinematográficos. El método fundamenta descripciones del lenguaje cinematográfico profesional en evidencia visual explícita, equilibrando la exhaustividad descriptiva y la corrección factual.
Evaluación sin referencia de la consistencia física en la generación de video basada en modelos del mundo
Los autores introducen medidas sin referencia para evaluar la consistencia física de los videos generados combinando evaluaciones de fidelidad relativa y absoluta. Este enfoque aborda la brecha en la fidelidad física que a menudo impide que herramientas de generación de video como WorldGym o WorldEval reproduzcan con precisión las tasas de éxito de tareas del mundo real para modelos VLA. A diferencia de los métodos existentes que requieren votación humana costosa o referencias ground-truth no disponibles, el nuevo marco utiliza DROID-SLAM y SEA-RAFT para cuantificar inconsistencias. Motivado por WorldScore, la evaluación de consistencia relativa filtra videos para mejorar las tasas de éxito de tareas en más del 8%. Además, la evaluación absoluta permite la localización espaciotemporal para visualizar cuándo y dónde ocurren los artefactos físicos en el contenido generado.
Nvidia adquiere Hugging Face; OpenAI lanza GPT-6 Astra; Microsoft presenta MAI-Transcribe-2
A principios de septiembre de 2026, Nvidia confirmó su adquisición de Hugging Face por $12.93 mil millones, mientras que OpenAI lanzó GPT-6 Astra y Microsoft presentó el modelo de reconocimiento de voz MAI-Transcribe-2.
Anthropic publica la tarjeta del sistema de Claude Fable 5.1 y Mythos 5.1
Anthropic ha publicado la tarjeta del sistema para Claude Fable 5.1 y Mythos 5.1, detallando sus perfiles de seguridad, riesgos de alineación y capacidades en comparación con modelos anteriores.