Los investigadores han presentado Kiwano, un kit de herramientas de código abierto diseñado para impulsar la investigación y la evaluación en el campo de la verificación del hablante. Construido sobre PyTorch, este marco ligero pero extensible proporciona recetas estandarizadas, modelos preentrenados e integración de arquitecturas ampliamente utilizadas. El proyecto enfatiza la reproducibilidad al ofrecer pipelines de entrenamiento transparentes, protocolos de evaluación unificados y líneas base listas para usar en múltiples corpus. Más allá de las capacidades estándar de entrenamiento e inferencia, Kiwano incluye herramientas especializadas para la evaluación comparativa, el seguimiento de experimentos y el prototipado rápido de nuevas arquitecturas. Para fomentar la adopción por parte de la comunidad, el kit de herramientas se distribuye bajo la licencia Apache 2.0 y viene acompañado de documentación completa y experimentos reproducibles. Al reducir las barreras de entrada y estandarizar las prácticas de evaluación, Kiwano tiene como objetivo servir como un recurso valioso tanto para la investigación académica como para el desarrollo aplicado. El proyecto está disponible públicamente en GitHub en https://github.com/kiwano-toolkit/kiwano/.
Kiwano: Un kit de herramientas PyTorch de código abierto para la investigación en verificación del hablante
El ranking Open TTS lanza una evaluación escalable de TTS multilingüe
Se ha publicado el ranking Open TTS para abordar la fragmentación y la falta de estandarización en la evaluación del texto a voz (TTS), utilizando métricas objetivas en lugar de depender únicamente de puntuaciones lentas de preferencia humana basadas en arenas. Evalúa modelos en inteligibilidad, velocidad y similitud del hablante mediante incrustaciones de Qwen3 ASR y WavLM.
Hume lanza el benchmark Real World VoiceEQ para la calidad de voz humana en IA
Hume ha presentado Real World VoiceEQ, un benchmark diseñado para evaluar la calidad humana de la interacción por voz mediante la evaluación de cuán bien los sistemas reconocen y producen información acústica más allá de las transcripciones. El benchmark evalúa más de 40 modelos propietarios y de código abierto en más de 15 dimensiones utilizando más de 60 métricas derivadas de 785,000 valoraciones humanas de TTS y 48,000 de STS.
Claude Opus 5 y Tetsu encuentran seis comprobaciones de CI huecas en su propio proyecto
El 27 de septiembre, Claude Opus 5 y el modelo Tetsu de 3B identificaron seis comprobaciones de integración continua separadas en su repositorio público que informaban estado verde o superaban la prueba a pesar de no verificar lo que se suponía que debían medir. Los problemas iban desde un filtro de despliegue que rechazaba reinicios válidos debido a resúmenes obsoletos hasta benchmarks de temporización con umbrales huecos que aceptaban diferencias de rendimiento insignificantes.
TontaubeV1 permite texto-a-voz en streaming con contexto acotado
Los investigadores presentan TontaubeV1, un modelo de texto-a-voz que preserva la prosodia natural mientras habilita inferencia en streaming desde una única GPU de consumo. El sistema utiliza una representación DualCodec jerárquica a 12.5 Hz para separar flujos semánticos de refinamientos acústicos, permitiendo generación de baja latencia.
TontaubeV1 permite texto-a-voz en streaming con contexto acotado
Los investigadores presentan TontaubeV1, un modelo de texto-a-voz que preserva la prosodia natural mientras habilita inferencia en streaming desde una única GPU de consumo. El sistema utiliza una representación DualCodec jerárquica a 12.5 Hz para separar las secuencias semánticas de los refinamientos acústicos, permitiendo la decodificación causal a pesar de la naturaleza no causal del códec subyacente.