Los investigadores presentan TelecomGPT-R1, una familia de modelos de razonamiento unificados de telecomunicaciones de código abierto diseñados para automatizar tareas de ingeniería mediante el razonamiento sobre estándares, configuraciones y registros. El modelo aborda las limitaciones de los LLMs existentes de propósito general y especializados a través de un enfoque estructurado que cubre ejes de protocolo, conocimiento, modelado y fallos.
- Un marco de generación de datos consciente del eje refina artefactos públicos de telecomunicaciones en 104.880 pares de pregunta-respuesta verificados con razonamiento paso a paso.
- El ajuste fino supervisado inculca conocimiento de telecomunicaciones para superar la barrera del inicio en frío para el aprendizaje por refuerzo.
- La optimización de políticas de muestreo dinámico (DAPO) con recompensas basadas en rúbricas dirigidas por tarea estabiliza las actualizaciones de RL en tareas heterogéneas.
- El modelo TelecomGPT-R1-27B alcanza una puntuación media del 89,64% en siete benchmarks del GSMA Open Telco Leaderboard, superando a GPT-5, Claude y Gemini.
Los autores publican los modelos y una receta de entrenamiento reproducible para apoyar el desarrollo comunitario en la automatización de telecomunicaciones.